老王的數學教室

課程地圖 / 第八章

數據分析

這一章只做兩件事:一維數據問「中心在哪裡、散得多開」,二維數據問「兩個變量有沒有一起動」。平均數、中位數、百分位數在講中心;變異數與標準差在講散開的程度;散佈圖、相關係數與迴歸直線則是把兩排數字放到平面上看它們的關係。下面每一張圖都可以拉、可以按,先看數字動起來,公式就不必硬背。

這一章包含的單元 第二冊單元八一維數據分析、單元九二維數據分析。章節架構、公式與例子依老王看世界〈108課綱學測數學總複習第八章 數據分析〉的七節編排。

平均數:三種平均,各有各的場合

平均數在回答「這組數據的中心大概落在哪裡」。同樣叫平均,算術平均數處理一般數值,加權平均數處理每筆數據份量不同的情形,幾何平均數則專門處理成長率這種「一直乘下去」的量。

算術平均數:把數線上的點撐平衡的那一點

n 筆數據 x₁, x₂, …, xn 的算術平均數是 μ = (x₁ + x₂ + ⋯ + xn) ∕ n。它有一個很好用的幾何意義:把每筆數據當成數線上的一顆珠子,平均數就是讓這根尺剛好平衡的支點位置。拉動下面四個滑桿看支點怎麼移動,順便看看一顆極端值可以把平均數拖走多遠。

四筆數據在數線上的位置與平均數支點四顆代表數據的圓點畫在同一條數線上,紅色三角形標出算術平均數的位置,每顆點到平均數的距離以虛線表示。
μ = (6 + 1 + 3 + 10) ∕ 4 = 5

把任何一顆點往右拉,支點就會跟著往右移一點。

加權平均數:每筆數據的份量不一樣

當每筆數據的重要性不同時,用權數 w₁, w₂, …, wn 表示份量,加權平均數是 (w₁x₁ + w₂x₂ + ⋯ + wnxn) ∕ (w₁ + w₂ + ⋯ + wn)。分母是權數總和,不是筆數——這是最常錯的地方。下面用一次開學考的四科成績試試看:分數固定,只調權數。

四科成績與權數(分數固定,權數可調)
科目國文英文數學歷史
分數60506050
權數4442
加權平均 = 780 ∕ 14 ≈ 55.71

把分數高的科目權數調大,加權平均就會被拉高;四科權數一樣時,加權平均等於算術平均 55。

幾何平均數:成長率要用乘的

連續 n 年的成長率分別為 r₁, r₂, …, rn 時,這 n 年的平均成長率是 n√((1 + r₁)(1 + r₂)⋯(1 + rn)) − 1。老王的口訣是「裡面都要 +1,外面都要 −1」。原文的例子:前年營業額 100 萬,去年成長 60%,今年衰退 60%,兩年平均是 √(1.6 × 0.4) − 1 = 0.8 − 1 = −20%——漲六成再跌六成,不是回到原點,而是平均每年衰退兩成。

√((1 + 60%) × (1 − 60%)) − 1 = √0.64 − 1 = −20%

兩年後的營業額是 100 × 1.6 × 0.4 = 64 萬,和用平均年成長率 −20% 連算兩年 100 × 0.8 × 0.8 = 64 萬完全一致。這就是幾何平均數的意義:把它拿來連乘,結果和原本一樣。

中位數與百分位數:先排序,再數位置

把一組數據由小到大排好之後,取最中間的那個數來代表中心位置,這個數就是中位數。數據為奇數個時取正中間那一個;為偶數個時取正中間兩個數的算術平均數。

中位數不怕極端值。上一節的支點會被一顆 40 分拉走,中位數卻只看排序後的位置——這是它在薪資、房價這類有少數極大值的數據上比平均數更常被引用的原因。

百分位數:用 99 個數把資料切成 100 等分

當數據筆數很大時,會用 99 個數把這組數據 100 等分,這 99 個數稱為百分位數,以 Pk 表示第 k 百分位數。它的意思是:至少有 k% 的數據小於或等於 Pk,且至少有 (100 − k)% 的數據大於或等於 Pk

計算方法只有一條分岔。把 n 筆數據由小到大排成 x₁, x₂, …, xn,令 a = n × k%

  • a 不是整數

    Pk = x 的下標取 a 的整數部分再 +1。例如 n = 250、k = 35,a = 87.5,所以 P₃₅ = x₈₈

  • a 是整數

    Pk = (xa + xa+1) ∕ 2。例如 n = 250、k = 60,a = 150,所以 P₆₀ = (x₁₅₀ + x₁₅₁) ∕ 2

下面這組 20 筆的成績已經排好序。拉動 k,看 a = 20 × k% 落在哪裡、走的是哪一條分岔。第 50 百分位數就是中位數,可以自己拉去驗證。

20 筆排序後的成績與第 k 百分位數的位置20 個方格由小到大排列並標出成績,用紅色標記目前 k 值對應的百分位數取用到的那一個或兩個位置。
a = 20 × 50% = 10(整數)→ P₅₀ = (x₁₀ + x₁₁) ∕ 2 = (72 + 74) ∕ 2 = 73

a 是整數就取兩個數的平均,不是整數就無條件往上進到下一個位置。k = 50 時算出來的就是中位數。

變異數與標準差:離均差平方的平均

平均數說了中心在哪裡,但沒說數據散得多開。把每筆數據和平均數的差(離均差)平方之後取平均,得到的就是變異數 σ²;再開正平方根就是標準差 σ

變異數σ² = (1 ∕ n)[(x₁ − μ)² + (x₂ − μ)² + ⋯ + (xn − μ)²] = (1 ∕ n)(x₁² + x₂² + ⋯ + xn²) − μ²

兩個式子完全等價。左邊的定義式好理解,右邊的「平方的平均減掉平均的平方」在手算時比較快,尤其當平均數不是整數的時候。要注意分母一律是 n。

為什麼要平方?因為離均差直接相加一定是 0——正負剛好抵銷,量不出散開的程度。平方之後把負號吃掉,大偏離還會被放大,這正是我們想要的效果。下面每一筆數據都畫出一個以離均差為邊長的正方形,變異數就是這些正方形面積的平均。

四筆數據的離均差平方示意圖四筆數據畫在同一條數線上,每一筆與平均數之間的差以線段標示,並在下方畫出以該差為邊長的正方形,用面積表示離均差平方。
μ = 8.5 σ² = 6.25 σ = 2.5

四筆數據 5, 8, 9, 12 的平均是 17∕2,標準差正好是 5∕2 —— 這就是原文的例子。把任何一筆往外拉,正方形面積立刻變大,標準差跟著上升。

數據的伸縮與平移:整組資料一起變的時候

當新數據由舊數據依 y = ax + b 產生時,平均數與標準差各自跟著變,但變的方式不一樣:μy = aμx + b,而 σy = |a| σx

關鍵在那個 b。平移是把整組數據一起搬家,彼此的相對距離沒有改變,所以標準差不受 b 影響;伸縮才會把距離拉開或壓縮,而且不管 a 是正是負,散開的程度都只看 |a|。原文的例子是溫度換算:y = (9∕5)x + 32,攝氏平均 30 度、標準差 6.5 度,換成華氏後平均是 86 度,標準差則是 (9∕5) × 6.5 = 11.7 而不是 11.7 + 32。

標準化:把任何一組數據換成平均 0、標準差 1

a = 1∕σb = −μ∕σ,也就是 yi = (xi − μ) ∕ σ,新數據的平均數是 0、標準差是 1。標準化後的數值在講一件事:這筆數據和平均數相差幾個標準差。標準化後是 3,表示比平均大 3 個標準差;是 −2,表示比平均小 2 個標準差。不同科目、不同單位的成績要比高下,就是先各自標準化再比。

原數據與變換後數據的兩條數線對照上方數線畫出原數據五個點與其平均數,下方數線畫出經過 y 等於 a x 加 b 變換後的五個點與新平均數,兩者以虛線對應。
快捷
μy = 1 × 10 + 0 = 10 σy = |1| × 2 = 2

原數據 7, 9, 10, 11, 13 的平均是 10、標準差是 2。只動 b 的時候,下面那排點整排搬家但間距不變,標準差不會變。

散佈圖:兩個變量放到平面上看

把 n 筆二維數據 (x₁, y₁), (x₂, y₂), …, (xn, yn) 一一畫成坐標平面上的點,得到的圖形稱為散佈圖。它是二維數據分析的第一步:先看形狀,再決定要不要算相關係數與迴歸直線。

  • 正相關

    x 變大時 y 也大致跟著變大,點群由左下往右上分布。

  • 負相關

    x 變大時 y 大致跟著變小,點群由左上往右下分布。

  • 零相關

    既不是正相關也不是負相關。點可能上下左右對稱散開,也可能完全落在平行 x 軸或平行 y 軸的直線上。

最後那一句常被忽略:一排水平的點看起來很整齊,但 y 完全不隨 x 改變,那是零相關,不是正相關。按下面的按鈕換一組資料看看。

選一組資料
五種散佈圖形狀的比較在同一組坐標軸上依選擇畫出資料點,並在圖上標出這組資料屬於正相關、負相關或零相關。

正相關:點群由左下往右上分布,x 增加時 y 大致跟著增加。

相關係數:把散佈圖的斜度變成一個數字

散佈圖是用看的,相關係數 r 則是把「兩個變量一起動的程度」量化成一個介於 −1 與 1 之間的數字。作法是先把 x 與 y 各自標準化,再取兩者乘積的平均。

相關係數r = (1 ∕ n) Σ ((xi − μx) ∕ σx) ((yi − μy) ∕ σy) = Sxy ∕ (√Sxx · √Syy)

其中 Sxy = Σ(xi − μx)(yi − μy)Sxx = Σ(xi − μxSyy = Σ(yi − μy。用 S 記號寫,分母的 n 會自己約掉,手算時少一次除法。

為什麼這個式子量得出相關?以 x, μy) 為原點把平面切成四塊:右上與左下的點,兩個離均差同號,乘積為正;左上與右下的點乘積為負。正的贏就是正相關,負的贏就是負相關,兩邊打平就接近零相關。下面拉動滑桿,看點怎麼在四個象限間移動、r 怎麼跟著跑。

相關係數的四象限示意圖以兩變量的平均數畫出十字線,把平面分成四個象限,落在右上與左下的點以紅色標示為正貢獻,落在左上與右下的點以深藍標示為負貢獻,右側顯示相關係數的計算結果。
Sxy = 153 Sxx = 28 Syy = 1073.43 r ≈ 0.883

正貢獻的點明顯多過負貢獻,r 接近 1,屬於強正相關。

幾個一定要記得的性質

  • 範圍

    −1 ≤ r ≤ 1r > 0 為正相關,r < 0 為負相關,r = 0 為零相關。

  • 完全相關

    r = 1 時所有點落在一條斜率為正的直線上,稱為完全正相關;r = −1 時所有點落在一條斜率為負的直線上,稱為完全負相關。

  • 相關不等於因果

    r 只描述兩個變量在數據上一起變動的程度,不能直接推論誰造成誰。

最小平方法與迴歸直線:畫一條最會預測的直線

當散佈圖顯示兩變量有直線關係時,常在圖中畫一條合適的直線作為模型,用來從 x 的值預測 y 的值。其中一種找線的方法是最小平方法:找一條直線 y = mx + k,使各點到該直線的鉛垂線段長度(也稱殘差)平方和最小,找到的直線稱為迴歸直線,也叫最佳直線或最適直線。

注意是鉛垂方向的距離,不是點到直線的垂直距離——因為我們要預測的是 y,衡量的自然是 y 方向差多少。

迴歸直線y − μy = (Sxy ∕ Sxx)(x − μx),即斜率 m = Sxy ∕ Sxx = r · (σy ∕ σx)

兩個寫法擇一即可:題目給你原始數據就用 Sxy ∕ Sxx,題目給的是平均數、標準差與相關係數就用 r · σy ∕ σx。而且不管用哪一個,迴歸直線一定通過 x, μy) 這個點——這是檢查答案最快的方法。

下面五筆數據的最小平方解是 y = 2x + 1。先自己拉 m 和 k 試著把灰色的殘差方塊縮到最小,再按「最小平方解」對照。

殘差平方和實驗散佈圖上有五個資料點與一條可調整的直線,每個點到直線的鉛垂線段畫成灰色方塊表示殘差平方,下方顯示目前的殘差平方和。
快捷
y = 1x + 4 殘差平方和 = 14

殘差平方和還可以再小。方塊的面積就是每一筆的殘差平方,把它們一起縮到最小的那條線才是迴歸直線。

預測要小心外推 迴歸直線是用手上這批數據配出來的,拿它去預測數據範圍內的 x 值比較可靠;超出範圍太多的預測(外推)沒有數據支撐,數學上算得出來,實際上不一定成立。

記憶軸:卡住的時候先問這四句

這一章公式不少,但真正的分岔只有四個。按一顆看它在講什麼。

按上面任一顆按鈕,這裡會出現對應的想法。

習題:基本與進階

下面 21 題涵蓋這一章的七個主題。可以直接在格子裡填答案,用底下的符號鍵盤點按也可以;分數請用斜線寫成 1/2 這樣,寫成小數 0.5 一樣算對,根號用 √ 這個鍵。想寫在紙上就用「拍照或上傳 PDF 作答」把手寫過程帶進來,照片和檔案只留在你自己的裝置上,不會上傳到任何地方。按「檢查答案」之後,對的會標正確,錯的會直接把正確答案和解法攤開。

關於題目來源 基本題 1 到 11 題逐題取自原文章〈108課綱學測數學總複習第八章 數據分析〉習題區的基本題,題目文字與數字都照原文。原文的進階題區目前只放了「好學範例1」的影片連結、尚未附上題目,所以下面的進階題 1 到 10 題,是依照原文同一章七節觀念與其所附例子另外編寫的,等原文的題目補上之後可以再替換。

基本原文習題區的十一題

1求 6, 1, 3, 10 的算術平均數。

符號鍵盤

你的紀錄:這一題還沒有作答紀錄。

2某次開學考國文 60 分,英文 50 分,數學 60 分,歷史 50 分,權數分別為國文 ×4,英文 ×4,數學 ×4,歷史 ×2,求這四科的加權平均數。

符號鍵盤

你的紀錄:這一題還沒有作答紀錄。

3求數據 3, 9, 27 的幾何平均數。

符號鍵盤

你的紀錄:這一題還沒有作答紀錄。

4將 40 位同學的成績由小到大排列:30, 32, 38, 46, 48, 52, 52, 53, 55, 59, 60, 60, 62, 62, 64, 68, 69, 70, 72, 72, 73, 75, 75, 76, 77, 78, 78, 79, 81, 82, 82, 83, 85, 86, 88, 88, 90, 96, 98。求第 15 百分位數與第 60 百分位數。

符號鍵盤

你的紀錄:這一題還沒有作答紀錄。

5求數據 6, 3, 2, 1 的變異數與標準差。

符號鍵盤

你的紀錄:這一題還沒有作答紀錄。

6原數據 X 的平均數 μX = 10,標準差 σX = 2,若新數據 Y 滿足 Y = 3X + 1,求新數據的平均數與標準差。

符號鍵盤

你的紀錄:這一題還沒有作答紀錄。

7原數據平均 10,標準差 4,其中一筆數據 18 標準化後的數據為何?

符號鍵盤

你的紀錄:這一題還沒有作答紀錄。

8畫出下表的身高與體重散布圖。

四位同學的身高與體重
身高 x164170168166
體重 y58625654

你的紀錄:這一題還沒有作答紀錄。

9下列哪些為正相關的散布圖?(把代號填進去,例如 (1)(2))

(1)
(2)
(3)
(4)
符號鍵盤

你的紀錄:這一題還沒有作答紀錄。

10求下表數據的相關係數。

四筆二維數據
x19212119
y22211922
符號鍵盤

你的紀錄:這一題還沒有作答紀錄。

11數據 (x₁, y₁), (x₂, y₂), …, (xn, yn) 中,x 平均數 μx = 70,標準差 σx = 8,y 平均數 μy = 60,標準差 σy = 6,相關係數 0.8,求 y 對 x 的最適直線。

符號鍵盤

你的紀錄:這一題還沒有作答紀錄。

進階依同章七節觀念補寫的十題

1某次段考全班成績的平均數為 60、標準差為 12。老師決定每人先加 5 分,再把總分乘以 1.2,也就是新成績 y = 1.2(x + 5)。求調整後的平均數與標準差。

符號鍵盤

你的紀錄:這一題還沒有作答紀錄。

2某次考試數學平均 55、標準差 10,某生數學考 70 分;英文平均 62、標準差 8,該生英文考 74 分。求兩科的標準化分數,並判斷哪一科表現較好(若一樣好請填「一樣」)。

符號鍵盤

你的紀錄:這一題還沒有作答紀錄。

3將 50 筆數據由小到大排列為 x₁, x₂, …, x₅₀。已知第 20 百分位數 P₂₀ = (x_a + x_b) ∕ 2,求 a 與 b(a < b)。

符號鍵盤

你的紀錄:這一題還沒有作答紀錄。

4一組數據為 1, 2, 2, 3, 4, 4, 4, 20。求中位數與算術平均數,並回答哪一個比較能代表這組數據的中心(填「中位數」或「平均數」)。

符號鍵盤

你的紀錄:這一題還沒有作答紀錄。

5某校甄選採計國、英、數、自、社五科,權重依序為 2 : 1 : 2 : 1 : 1。某生五科級分依序為 12, 10, 13, 11, 9,求他的加權平均級分。

符號鍵盤

你的紀錄:這一題還沒有作答紀錄。

6某商品的價格連續兩年變動:第一年上漲 25%,第二年下跌 20%。求這兩年的平均年成長率(以百分比或小數作答)。

符號鍵盤

你的紀錄:這一題還沒有作答紀錄。

7某 5 筆數據滿足 Σx = 40、Σx² = 360。求這組數據的平均數、變異數與標準差。

符號鍵盤

你的紀錄:這一題還沒有作答紀錄。

8求下表數據的相關係數。

五筆二維數據
x12345
y45312
符號鍵盤

你的紀錄:這一題還沒有作答紀錄。

9兩變量 x 與 y 的數據中,μx = 50、σx = 10、μy = 30、σy = 4、相關係數 r = 0.5。求 y 對 x 的迴歸直線,並用它預測 x = 60 時的 y 值。

符號鍵盤

你的紀錄:這一題還沒有作答紀錄。

10已知兩變量 x 與 y 的三筆數據為 (0, 1), (1, 2), (−1, −3),求 y 對 x 的迴歸直線。

符號鍵盤

你的紀錄:這一題還沒有作答紀錄。

好學範例影片

原文章在進階題區附上的好學範例,取材自龍騰學測數 A 好好學複習講義 L7 數據分析的例題。習題卡住的時候可以先看這一支。

好學範例 1

影片來源 影片為老王看世界頻道發布於乾淨世界的內容,這裡以原站嵌入播放器呈現。原文的進階題區目前只放了這一支影片,題目尚未附上;等原文補齊之後,這一頁的進階題可以再換成原文版本。