課程地圖 / 第八章
數據分析
這一章只做兩件事:一維數據問「中心在哪裡、散得多開」,二維數據問「兩個變量有沒有一起動」。平均數、中位數、百分位數在講中心;變異數與標準差在講散開的程度;散佈圖、相關係數與迴歸直線則是把兩排數字放到平面上看它們的關係。下面每一張圖都可以拉、可以按,先看數字動起來,公式就不必硬背。
這一章包含的單元 第二冊單元八一維數據分析、單元九二維數據分析。章節架構、公式與例子依老王看世界〈108課綱學測數學總複習第八章 數據分析〉的七節編排。
平均數:三種平均,各有各的場合
平均數在回答「這組數據的中心大概落在哪裡」。同樣叫平均,算術平均數處理一般數值,加權平均數處理每筆數據份量不同的情形,幾何平均數則專門處理成長率這種「一直乘下去」的量。
算術平均數:把數線上的點撐平衡的那一點
n 筆數據 x₁, x₂, …, xn 的算術平均數是 μ = (x₁ + x₂ + ⋯ + xn) ∕ n。它有一個很好用的幾何意義:把每筆數據當成數線上的一顆珠子,平均數就是讓這根尺剛好平衡的支點位置。拉動下面四個滑桿看支點怎麼移動,順便看看一顆極端值可以把平均數拖走多遠。
把任何一顆點往右拉,支點就會跟著往右移一點。
加權平均數:每筆數據的份量不一樣
當每筆數據的重要性不同時,用權數 w₁, w₂, …, wn 表示份量,加權平均數是 (w₁x₁ + w₂x₂ + ⋯ + wnxn) ∕ (w₁ + w₂ + ⋯ + wn)。分母是權數總和,不是筆數——這是最常錯的地方。下面用一次開學考的四科成績試試看:分數固定,只調權數。
| 科目 | 國文 | 英文 | 數學 | 歷史 |
|---|---|---|---|---|
| 分數 | 60 | 50 | 60 | 50 |
| 權數 | 4 | 4 | 4 | 2 |
把分數高的科目權數調大,加權平均就會被拉高;四科權數一樣時,加權平均等於算術平均 55。
幾何平均數:成長率要用乘的
連續 n 年的成長率分別為 r₁, r₂, …, rn 時,這 n 年的平均成長率是 n√((1 + r₁)(1 + r₂)⋯(1 + rn)) − 1。老王的口訣是「裡面都要 +1,外面都要 −1」。原文的例子:前年營業額 100 萬,去年成長 60%,今年衰退 60%,兩年平均是 √(1.6 × 0.4) − 1 = 0.8 − 1 = −20%——漲六成再跌六成,不是回到原點,而是平均每年衰退兩成。
兩年後的營業額是 100 × 1.6 × 0.4 = 64 萬,和用平均年成長率 −20% 連算兩年 100 × 0.8 × 0.8 = 64 萬完全一致。這就是幾何平均數的意義:把它拿來連乘,結果和原本一樣。
中位數與百分位數:先排序,再數位置
把一組數據由小到大排好之後,取最中間的那個數來代表中心位置,這個數就是中位數。數據為奇數個時取正中間那一個;為偶數個時取正中間兩個數的算術平均數。
中位數不怕極端值。上一節的支點會被一顆 40 分拉走,中位數卻只看排序後的位置——這是它在薪資、房價這類有少數極大值的數據上比平均數更常被引用的原因。
百分位數:用 99 個數把資料切成 100 等分
當數據筆數很大時,會用 99 個數把這組數據 100 等分,這 99 個數稱為百分位數,以 Pk 表示第 k 百分位數。它的意思是:至少有 k% 的數據小於或等於 Pk,且至少有 (100 − k)% 的數據大於或等於 Pk。
計算方法只有一條分岔。把 n 筆數據由小到大排成 x₁, x₂, …, xn,令 a = n × k%:
- a 不是整數
Pk = x 的下標取 a 的整數部分再 +1。例如 n = 250、k = 35,a = 87.5,所以 P₃₅ = x₈₈。
- a 是整數
Pk = (xa + xa+1) ∕ 2。例如 n = 250、k = 60,a = 150,所以 P₆₀ = (x₁₅₀ + x₁₅₁) ∕ 2。
下面這組 20 筆的成績已經排好序。拉動 k,看 a = 20 × k% 落在哪裡、走的是哪一條分岔。第 50 百分位數就是中位數,可以自己拉去驗證。
a 是整數就取兩個數的平均,不是整數就無條件往上進到下一個位置。k = 50 時算出來的就是中位數。
變異數與標準差:離均差平方的平均
平均數說了中心在哪裡,但沒說數據散得多開。把每筆數據和平均數的差(離均差)平方之後取平均,得到的就是變異數 σ²;再開正平方根就是標準差 σ。
兩個式子完全等價。左邊的定義式好理解,右邊的「平方的平均減掉平均的平方」在手算時比較快,尤其當平均數不是整數的時候。要注意分母一律是 n。
為什麼要平方?因為離均差直接相加一定是 0——正負剛好抵銷,量不出散開的程度。平方之後把負號吃掉,大偏離還會被放大,這正是我們想要的效果。下面每一筆數據都畫出一個以離均差為邊長的正方形,變異數就是這些正方形面積的平均。
四筆數據 5, 8, 9, 12 的平均是 17∕2,標準差正好是 5∕2 —— 這就是原文的例子。把任何一筆往外拉,正方形面積立刻變大,標準差跟著上升。
數據的伸縮與平移:整組資料一起變的時候
當新數據由舊數據依 y = ax + b 產生時,平均數與標準差各自跟著變,但變的方式不一樣:μy = aμx + b,而 σy = |a| σx。
關鍵在那個 b。平移是把整組數據一起搬家,彼此的相對距離沒有改變,所以標準差不受 b 影響;伸縮才會把距離拉開或壓縮,而且不管 a 是正是負,散開的程度都只看 |a|。原文的例子是溫度換算:y = (9∕5)x + 32,攝氏平均 30 度、標準差 6.5 度,換成華氏後平均是 86 度,標準差則是 (9∕5) × 6.5 = 11.7 而不是 11.7 + 32。
標準化:把任何一組數據換成平均 0、標準差 1
取 a = 1∕σ、b = −μ∕σ,也就是 yi = (xi − μ) ∕ σ,新數據的平均數是 0、標準差是 1。標準化後的數值在講一件事:這筆數據和平均數相差幾個標準差。標準化後是 3,表示比平均大 3 個標準差;是 −2,表示比平均小 2 個標準差。不同科目、不同單位的成績要比高下,就是先各自標準化再比。
原數據 7, 9, 10, 11, 13 的平均是 10、標準差是 2。只動 b 的時候,下面那排點整排搬家但間距不變,標準差不會變。
散佈圖:兩個變量放到平面上看
把 n 筆二維數據 (x₁, y₁), (x₂, y₂), …, (xn, yn) 一一畫成坐標平面上的點,得到的圖形稱為散佈圖。它是二維數據分析的第一步:先看形狀,再決定要不要算相關係數與迴歸直線。
- 正相關
x 變大時 y 也大致跟著變大,點群由左下往右上分布。
- 負相關
x 變大時 y 大致跟著變小,點群由左上往右下分布。
- 零相關
既不是正相關也不是負相關。點可能上下左右對稱散開,也可能完全落在平行 x 軸或平行 y 軸的直線上。
最後那一句常被忽略:一排水平的點看起來很整齊,但 y 完全不隨 x 改變,那是零相關,不是正相關。按下面的按鈕換一組資料看看。
正相關:點群由左下往右上分布,x 增加時 y 大致跟著增加。
相關係數:把散佈圖的斜度變成一個數字
散佈圖是用看的,相關係數 r 則是把「兩個變量一起動的程度」量化成一個介於 −1 與 1 之間的數字。作法是先把 x 與 y 各自標準化,再取兩者乘積的平均。
其中 Sxy = Σ(xi − μx)(yi − μy)、Sxx = Σ(xi − μx)²、Syy = Σ(yi − μy)²。用 S 記號寫,分母的 n 會自己約掉,手算時少一次除法。
為什麼這個式子量得出相關?以 (μx, μy) 為原點把平面切成四塊:右上與左下的點,兩個離均差同號,乘積為正;左上與右下的點乘積為負。正的贏就是正相關,負的贏就是負相關,兩邊打平就接近零相關。下面拉動滑桿,看點怎麼在四個象限間移動、r 怎麼跟著跑。
正貢獻的點明顯多過負貢獻,r 接近 1,屬於強正相關。
幾個一定要記得的性質
- 範圍
−1 ≤ r ≤ 1。r > 0 為正相關,r < 0 為負相關,r = 0 為零相關。
- 完全相關
r = 1 時所有點落在一條斜率為正的直線上,稱為完全正相關;r = −1 時所有點落在一條斜率為負的直線上,稱為完全負相關。
- 相關不等於因果
r 只描述兩個變量在數據上一起變動的程度,不能直接推論誰造成誰。
最小平方法與迴歸直線:畫一條最會預測的直線
當散佈圖顯示兩變量有直線關係時,常在圖中畫一條合適的直線作為模型,用來從 x 的值預測 y 的值。其中一種找線的方法是最小平方法:找一條直線 y = mx + k,使各點到該直線的鉛垂線段長度(也稱殘差)平方和最小,找到的直線稱為迴歸直線,也叫最佳直線或最適直線。
注意是鉛垂方向的距離,不是點到直線的垂直距離——因為我們要預測的是 y,衡量的自然是 y 方向差多少。
兩個寫法擇一即可:題目給你原始數據就用 Sxy ∕ Sxx,題目給的是平均數、標準差與相關係數就用 r · σy ∕ σx。而且不管用哪一個,迴歸直線一定通過 (μx, μy) 這個點——這是檢查答案最快的方法。
下面五筆數據的最小平方解是 y = 2x + 1。先自己拉 m 和 k 試著把灰色的殘差方塊縮到最小,再按「最小平方解」對照。
殘差平方和還可以再小。方塊的面積就是每一筆的殘差平方,把它們一起縮到最小的那條線才是迴歸直線。
預測要小心外推 迴歸直線是用手上這批數據配出來的,拿它去預測數據範圍內的 x 值比較可靠;超出範圍太多的預測(外推)沒有數據支撐,數學上算得出來,實際上不一定成立。
記憶軸:卡住的時候先問這四句
這一章公式不少,但真正的分岔只有四個。按一顆看它在講什麼。
按上面任一顆按鈕,這裡會出現對應的想法。
習題:基本與進階
下面 21 題涵蓋這一章的七個主題。可以直接在格子裡填答案,用底下的符號鍵盤點按也可以;分數請用斜線寫成 1/2 這樣,寫成小數 0.5 一樣算對,根號用 √ 這個鍵。想寫在紙上就用「拍照或上傳 PDF 作答」把手寫過程帶進來,照片和檔案只留在你自己的裝置上,不會上傳到任何地方。按「檢查答案」之後,對的會標正確,錯的會直接把正確答案和解法攤開。
關於題目來源 基本題 1 到 11 題逐題取自原文章〈108課綱學測數學總複習第八章 數據分析〉習題區的基本題,題目文字與數字都照原文。原文的進階題區目前只放了「好學範例1」的影片連結、尚未附上題目,所以下面的進階題 1 到 10 題,是依照原文同一章七節觀念與其所附例子另外編寫的,等原文的題目補上之後可以再替換。
基本原文習題區的十一題
1求 6, 1, 3, 10 的算術平均數。
你的紀錄:這一題還沒有作答紀錄。
正確答案 5
算術平均數是總和除以筆數:(6 + 1 + 3 + 10) ∕ 4 = 20 ∕ 4 = 5。四筆數據就除以 4,不要看到最大的 10 就急著往中間猜。
2某次開學考國文 60 分,英文 50 分,數學 60 分,歷史 50 分,權數分別為國文 ×4,英文 ×4,數學 ×4,歷史 ×2,求這四科的加權平均數。
你的紀錄:這一題還沒有作答紀錄。
正確答案 780 ∕ 14 = 390 ∕ 7 ≈ 55.71
加權平均數 = (60×4 + 50×4 + 60×4 + 50×2) ∕ (4 + 4 + 4 + 2) = (240 + 200 + 240 + 100) ∕ 14 = 780 ∕ 14 = 390 ∕ 7 ≈ 55.71。
最常見的錯誤是分母寫成科目數 4。加權平均數的分母是權數總和 14,不是筆數。順帶一提,四科的算術平均是 (60 + 50 + 60 + 50) ∕ 4 = 55,因為權數大的兩科一高一低,加權後只比它高一點點。
3求數據 3, 9, 27 的幾何平均數。
你的紀錄:這一題還沒有作答紀錄。
正確答案 9
三筆數據的幾何平均數是連乘之後開三次方:³√(3 × 9 × 27) = ³√729 = 9。也可以用指數看:3 × 9 × 27 = 3¹ × 3² × 3³ = 3⁶,開三次方就是 3² = 9。
注意幾何平均數是用乘的再開根號,不是相加除以 3(那會得到 13)。
4將 40 位同學的成績由小到大排列:30, 32, 38, 46, 48, 52, 52, 53, 55, 59, 60, 60, 62, 62, 64, 68, 69, 70, 72, 72, 73, 75, 75, 76, 77, 78, 78, 79, 81, 82, 82, 83, 85, 86, 88, 88, 90, 96, 98。求第 15 百分位數與第 60 百分位數。
你的紀錄:這一題還沒有作答紀錄。
正確答案 P₁₅ = 52;P₆₀ = 76(若依題目所寫的 40 筆計算則為 76.5,兩種都算對)
P₁₅:a = n × 15%。依原文所寫的 n = 40,a = 6 是整數,所以 P₁₅ = (x₆ + x₇) ∕ 2 = (52 + 52) ∕ 2 = 52。若依實際列出的 39 筆計算,a = 39 × 15% = 5.85 不是整數,取整數部分 +1,P₁₅ = x₆ = 52。兩種算法都得到 52。
P₆₀:依 n = 40,a = 24 是整數,P₆₀ = (x₂₄ + x₂₅) ∕ 2 = (76 + 77) ∕ 2 = 76.5;依實際列出的 39 筆,a = 23.4 不是整數,P₆₀ = x₂₄ = 76。
提醒 原文這一題寫「40 位同學」,但題目實際列出的數字只有 39 個。這裡兩種讀法的答案都判正確,並把過程都寫出來給你對照。真正要記住的是那條分岔:a = n × k% 是整數就取第 a 與第 a+1 個數的平均,不是整數就取整數部分 +1 的那一個數。
5求數據 6, 3, 2, 1 的變異數與標準差。
你的紀錄:這一題還沒有作答紀錄。
正確答案 σ² = 3.5 = 7 ∕ 2;σ = √3.5 = √14 ∕ 2 ≈ 1.87
先求平均數:μ = (6 + 3 + 2 + 1) ∕ 4 = 3。離均差是 3, 0, −1, −2,平方後為 9, 0, 1, 4,所以 σ² = (9 + 0 + 1 + 4) ∕ 4 = 14 ∕ 4 = 3.5,σ = √3.5 = √14 ∕ 2 ≈ 1.87。
用另一個公式檢查:(6² + 3² + 2² + 1²) ∕ 4 − 3² = 50 ∕ 4 − 9 = 12.5 − 9 = 3.5,一致。分母一律是 n = 4。
6原數據 X 的平均數 μX = 10,標準差 σX = 2,若新數據 Y 滿足 Y = 3X + 1,求新數據的平均數與標準差。
你的紀錄:這一題還沒有作答紀錄。
正確答案 μ_Y = 31;σ_Y = 6
用 y = ax + b 的規則:μ_Y = a μ_X + b = 3 × 10 + 1 = 31,σ_Y = |a| σ_X = 3 × 2 = 6。
平移的那個 +1 只影響平均數,不影響標準差——整組數據一起搬家,彼此的距離沒變,散開的程度自然不變。
7原數據平均 10,標準差 4,其中一筆數據 18 標準化後的數據為何?
你的紀錄:這一題還沒有作答紀錄。
正確答案 2
標準化的公式是 (x − μ) ∕ σ = (18 − 10) ∕ 4 = 8 ∕ 4 = 2。
這個 2 的意思是:這筆數據比平均數大了 2 個標準差。標準化之後整組數據的平均變成 0、標準差變成 1,所以不同科目、不同單位的成績可以放在一起比。
8畫出下表的身高與體重散布圖。
| 身高 x | 164 | 170 | 168 | 166 |
|---|---|---|---|---|
| 體重 y | 58 | 62 | 56 | 54 |
你的紀錄:這一題還沒有作答紀錄。
正確畫法
畫散布圖只要三個動作:決定哪一個變量當橫軸、標好刻度範圍、把每一組 (x, y) 點上去。這一題點完之後可以看出身高高的同學體重大致也比較重,屬於正相關,但四個點裡 (168, 56) 偏低,所以不是完全正相關。
9下列哪些為正相關的散布圖?(把代號填進去,例如 (1)(2))
你的紀錄:這一題還沒有作答紀錄。
正確答案 (1)(3)
(1) 點群由左下往右上散開,x 變大時 y 大致跟著變大,是正相關。(3) 所有點落在一條斜率為正的直線上,是完全正相關,當然也是正相關(r = 1)。
(2) 由左上往右下,是負相關。(4) 是最容易被誤判的一張:點排得很整齊,但 y 完全不隨 x 改變,這是零相關,不是正相關。
10求下表數據的相關係數。
| x | 19 | 21 | 21 | 19 |
|---|---|---|---|---|
| y | 22 | 21 | 19 | 22 |
你的紀錄:這一題還沒有作答紀錄。
正確答案 −2 ∕ √6 = −√6 ∕ 3 ≈ −0.82
先算兩個平均數:μ_x = (19 + 21 + 21 + 19) ∕ 4 = 20,μ_y = (22 + 21 + 19 + 22) ∕ 4 = 21。
離均差:x 是 −1, 1, 1, −1;y 是 1, 0, −2, 1。
S_xy = (−1)(1) + (1)(0) + (1)(−2) + (−1)(1) = −4;S_xx = 1 + 1 + 1 + 1 = 4;S_yy = 1 + 0 + 4 + 1 = 6。
r = S_xy ∕ (√S_xx · √S_yy) = −4 ∕ (2√6) = −2 ∕ √6 = −√6 ∕ 3 ≈ −0.82。負值代表負相關,絕對值接近 1 表示關聯還算強。
11數據 (x₁, y₁), (x₂, y₂), …, (xn, yn) 中,x 平均數 μx = 70,標準差 σx = 8,y 平均數 μy = 60,標準差 σy = 6,相關係數 0.8,求 y 對 x 的最適直線。
你的紀錄:這一題還沒有作答紀錄。
正確答案 y = 0.6x + 18
題目給的是平均數、標準差與相關係數,所以斜率用 m = r · (σ_y ∕ σ_x) = 0.8 × (6 ∕ 8) = 0.6。
迴歸直線一定通過 (μ_x, μ_y) = (70, 60),所以 y − 60 = 0.6(x − 70),展開得 y = 0.6x − 42 + 60 = 0.6x + 18。
檢查:把 x = 70 代回去得 y = 42 + 18 = 60,確實通過 (70, 60)。
進階依同章七節觀念補寫的十題
1某次段考全班成績的平均數為 60、標準差為 12。老師決定每人先加 5 分,再把總分乘以 1.2,也就是新成績 y = 1.2(x + 5)。求調整後的平均數與標準差。
你的紀錄:這一題還沒有作答紀錄。
正確答案 平均數 78;標準差 14.4
先把式子整理成 y = ax + b 的樣子:y = 1.2(x + 5) = 1.2x + 6,所以 a = 1.2、b = 6。
μ_y = 1.2 × 60 + 6 = 72 + 6 = 78;σ_y = |1.2| × 12 = 14.4。
加分的那 5 分先被乘以 1.2 變成 6,只進平均數;標準差只認 a = 1.2,跟 b 無關。
2某次考試數學平均 55、標準差 10,某生數學考 70 分;英文平均 62、標準差 8,該生英文考 74 分。求兩科的標準化分數,並判斷哪一科表現較好(若一樣好請填「一樣」)。
你的紀錄:這一題還沒有作答紀錄。
正確答案 數學 1.5;英文 1.5;一樣
數學:(70 − 55) ∕ 10 = 1.5。英文:(74 − 62) ∕ 8 = 1.5。
兩科的標準化分數都是 1.5,表示這位同學在兩科都恰好比班平均高出 1.5 個標準差,相對表現一樣好。
直接比原始分數會誤判成英文比較好(74 > 70),但兩科的平均與標準差都不同,一定要先標準化再比。
3將 50 筆數據由小到大排列為 x₁, x₂, …, x₅₀。已知第 20 百分位數 P₂₀ = (x_a + x_b) ∕ 2,求 a 與 b(a < b)。
你的紀錄:這一題還沒有作答紀錄。
正確答案 a = 10;b = 11
a = n × k% = 50 × 20% = 10,剛好是整數,走的是「取平均」那一條分岔,所以 P₂₀ = (x₁₀ + x₁₁) ∕ 2。
如果題目改成 P₂₅,則 50 × 25% = 12.5 不是整數,就要取整數部分 12 再 +1,P₂₅ = x₁₃,不是兩個數的平均。同一組數據,k 換了就可能換一條分岔。
4一組數據為 1, 2, 2, 3, 4, 4, 4, 20。求中位數與算術平均數,並回答哪一個比較能代表這組數據的中心(填「中位數」或「平均數」)。
你的紀錄:這一題還沒有作答紀錄。
正確答案 中位數 3.5;平均數 5;中位數
數據已由小到大排好,共 8 筆(偶數個),中位數是正中間兩個數 3 與 4 的算術平均:(3 + 4) ∕ 2 = 3.5。
平均數 = (1 + 2 + 2 + 3 + 4 + 4 + 4 + 20) ∕ 8 = 40 ∕ 8 = 5。
八筆數據裡有七筆都不超過 4,平均數卻被那一筆 20 拉到 5,比七筆數據都大。這種有極端值的情形,中位數比較能代表中心——它只看排序後的位置,不管最大的那筆有多大。
5某校甄選採計國、英、數、自、社五科,權重依序為 2 : 1 : 2 : 1 : 1。某生五科級分依序為 12, 10, 13, 11, 9,求他的加權平均級分。
你的紀錄:這一題還沒有作答紀錄。
正確答案 80 ∕ 7 ≈ 11.43
分子 = 12×2 + 10×1 + 13×2 + 11×1 + 9×1 = 24 + 10 + 26 + 11 + 9 = 80。
分母是權數總和 = 2 + 1 + 2 + 1 + 1 = 7,不是科目數 5。
加權平均 = 80 ∕ 7 ≈ 11.43。順帶一提,五科的算術平均是 55 ∕ 5 = 11,加權後比較高,因為權重大的國文與數學正好是他考得比較好的兩科。
6某商品的價格連續兩年變動:第一年上漲 25%,第二年下跌 20%。求這兩年的平均年成長率(以百分比或小數作答)。
你的紀錄:這一題還沒有作答紀錄。
正確答案 0(即 0%)
成長率要用幾何平均:√((1 + 25%)(1 − 20%)) − 1 = √(1.25 × 0.8) − 1 = √1 − 1 = 1 − 1 = 0。
驗證一下:原價 100 元漲 25% 變 125 元,再跌 20% 變 125 × 0.8 = 100 元,剛好回到原點,所以平均年成長率是 0%。
對照原文的例子:漲 60% 再跌 60% 卻是平均每年衰退 20%。差別在於漲跌的百分比是對不同的基準算的,所以不能直接把 +25% 和 −20% 相加除以 2。
7某 5 筆數據滿足 Σx = 40、Σx² = 360。求這組數據的平均數、變異數與標準差。
你的紀錄:這一題還沒有作答紀錄。
正確答案 μ = 8;σ² = 8;σ = 2√2 ≈ 2.83
μ = Σx ∕ n = 40 ∕ 5 = 8。
用「平方的平均減掉平均的平方」:σ² = (Σx²) ∕ n − μ² = 360 ∕ 5 − 8² = 72 − 64 = 8。
σ = √8 = 2√2 ≈ 2.83。
題目只給總和與平方和、沒給個別數據時,就一定要用這個版本的公式;用定義式反而無從下手。
8求下表數據的相關係數。
| x | 1 | 2 | 3 | 4 | 5 |
|---|---|---|---|---|---|
| y | 4 | 5 | 3 | 1 | 2 |
你的紀錄:這一題還沒有作答紀錄。
正確答案 −0.8 = −4 ∕ 5
μ_x = (1 + 2 + 3 + 4 + 5) ∕ 5 = 3,μ_y = (4 + 5 + 3 + 1 + 2) ∕ 5 = 3。
x 的離均差:−2, −1, 0, 1, 2;y 的離均差:1, 2, 0, −2, −1。
S_xy = (−2)(1) + (−1)(2) + 0 + (1)(−2) + (2)(−1) = −2 − 2 + 0 − 2 − 2 = −8。
S_xx = 4 + 1 + 0 + 1 + 4 = 10,S_yy = 1 + 4 + 0 + 4 + 1 = 10。
r = −8 ∕ (√10 · √10) = −8 ∕ 10 = −0.8,屬於強負相關。
9兩變量 x 與 y 的數據中,μx = 50、σx = 10、μy = 30、σy = 4、相關係數 r = 0.5。求 y 對 x 的迴歸直線,並用它預測 x = 60 時的 y 值。
你的紀錄:這一題還沒有作答紀錄。
正確答案 y = 0.2x + 20;預測值 32
斜率 m = r · (σ_y ∕ σ_x) = 0.5 × (4 ∕ 10) = 0.2。
迴歸直線通過 (μ_x, μ_y) = (50, 30):y − 30 = 0.2(x − 50),得 y = 0.2x − 10 + 30 = 0.2x + 20。
代入 x = 60:y = 0.2 × 60 + 20 = 12 + 20 = 32。
x = 60 離 x 的平均 50 只有一個標準差,仍在數據的合理範圍內,這樣的預測比較可靠;如果拿去預測 x = 200,就是沒有數據支撐的外推了。
10已知兩變量 x 與 y 的三筆數據為 (0, 1), (1, 2), (−1, −3),求 y 對 x 的迴歸直線。
你的紀錄:這一題還沒有作答紀錄。
正確答案 y = 2.5x = (5 ∕ 2)x
μ_x = (0 + 1 − 1) ∕ 3 = 0,μ_y = (1 + 2 − 3) ∕ 3 = 0。兩個平均數都是 0,計算會輕鬆很多。
S_xy = (0)(1) + (1)(2) + (−1)(−3) = 0 + 2 + 3 = 5;S_xx = 0² + 1² + (−1)² = 2。
斜率 m = S_xy ∕ S_xx = 5 ∕ 2 = 2.5,又因為直線通過 (0, 0),所以截距 k = 0,迴歸直線為 y = 2.5x。
這一題就是原文第七節裡用來說明最小平方法的那三筆數據。用最小平方法的原意檢查:這條線讓三個點的鉛垂殘差平方和最小。
好學範例影片
原文章在進階題區附上的好學範例,取材自龍騰學測數 A 好好學複習講義 L7 數據分析的例題。習題卡住的時候可以先看這一支。
影片來源 影片為老王看世界頻道發布於乾淨世界的內容,這裡以原站嵌入播放器呈現。原文的進階題區目前只放了這一支影片,題目尚未附上;等原文補齊之後,這一頁的進階題可以再換成原文版本。