先備:假設檢定是一條決策流程
題面來自台大官方試卷;解答與逐項自評標準(rubric)為本站技術覆核的非官方內容,申論與推導一律採自評。
考古題證據邊界: 這是迴歸 F 檢定與卡方檢定的共同先備,不代表歷屆題涵蓋所有檢定。
第一次接觸也沒關係
這堂先懂這些詞
先記住白話意思,不必急著背英文。看到正文時,再把正式名稱接回來。
虛無假設與對立假設
也會看到:null hypothesis、alternative hypothesis、H0、H₀、H1、H₁H₀ 讀作「H 零」,是檢定暫時保留的基準說法;H₁ 讀作「H 一」,是資料足夠反對 H₀ 時所支持的方向。
- 生活例子:
- 煙霧警報器先以「沒有火災」為 H₀,只有感測訊號夠異常才改採「可能有火災」的 H₁。
- 別搞混:
- 未拒絕 H₀ 只代表證據不夠,不等於已經證明 H₀ 正確。
檢定統計量與參考分配
也會看到:test statistic、reference distribution、sampling distribution檢定統計量把樣本證據濃縮成一個數字,參考分配則告訴我們在 H₀ 成立時這個數字通常會落在哪裡。
- 生活例子:
- 警報器把溫度與煙霧濃度濃縮成警戒分數,再拿正常環境下的分數範圍作比較。
- 別搞混:
- 不同資料型態與假設條件要用不同統計量和分配,不能看到數字大就一律判為顯著。
顯著水準
也會看到:significance level、α、alpha、α=0.05顯著水準 α 讀作「alpha」,是分析前設定的拒絕門檻,例如 α=0.05 表示願意承擔至多約 5% 的第一類錯誤風險。
- 生活例子:
- 煙霧警報器把門檻調得越嚴格,越不容易誤報,但也可能更容易漏掉真正異常。
- 別搞混:
- α 不是 H₀ 為真的機率,也不該看完 p 值後才為了得到想要的結論而更改。
p 值
也會看到:p-value、p value、pp 值是在 H₀ 成立的前提下,得到目前這麼極端或更極端資料的機率;p 讀作英文字母「p」。
- 生活例子:
- 若正常廚房幾乎不會出現目前這麼高的煙霧讀值,p 值就會很小。
- 別搞混:
- p 值不是 H₀ 為真的機率、不是結果由偶然造成的機率,也不表示效果大小。
統計顯著與未拒絕
也會看到:statistical significance、reject H0、fail to reject H0、p<α當 p<α(讀作「p 小於 alpha」)時稱結果達統計顯著並拒絕 H₀,否則只能說未能拒絕 H₀。
- 生活例子:
- 警報響起代表訊號越過預設門檻,但仍要由人確認是否真的起火及原因為何。
- 別搞混:
- 統計顯著不等於效果很大、實務上重要或已證明因果;未顯著也不等於兩者完全沒有差異。
逐項自評標準
也會看到:rubric、評分規準把完整推導拆成可以逐步核對的要點,幫你找到漏掉的條件或計算步驟。
- 生活例子:
- 像算完帳後依序檢查金額、單位、公式與最後結論。
- 別搞混:
- 它不是官方配分,也不會把合理但不同的推導方式判成錯誤。
把 H0/H1、統計量、參考分配、p 值與結論串成同一條不跳步的流程。
先抓住這幾件事
- 寫出正確的 H0/H1 對,並說明為什麼 H0 包含等號
- 根據資料類型和假設選擇 z 檢定或 t 檢定
- 用 p 值和顯著水準 α 做出拒絕或不拒絕的決策
- 區分 Type I 和 Type II 錯誤,解釋 power 的意義
先想像這個場景
煙霧警報器的決策
警報器先假設沒有火災,再看感測訊號是否異常到足以推翻原假設。
先別急著套公式,花十秒想一想:
警報響了,能否直接斷言起火原因?
把故事換成統計語言
| 生活中的角色 | 對應到 | 統計概念 |
|---|---|---|
| 先假設沒有火災 | 虛無假設 H0 | |
| 感測器異常程度 | test statistic | |
| 允許的誤報門檻 | significance level α | |
| 警報後的決策 | reject / fail to reject H0 |
題目出現這些字,先想到
- H0/H1
- α=0.05
- p-value
- reject H0
1.第一步:把問題翻譯成假設對
假設檢定從兩個互斥的母體宣稱開始。虛無假設 H0 代表「什麼都沒發生」或「沒有差異」,它一定包含等號(=, ≤, ≥)。對立假設 H1(或 Ha)是你真正想主張的方向。 【為什麼 H0 有等號?】因為我們需要在 H0 為真的精確情境下算出統計量的分佈。如果 H0 是模糊的「μ 可能是任何值」,就無法算 p 值。所以 H0 固定一個基準點,然後看資料離這個基準點有多遠。 【範例】某藥廠宣稱新藥平均降壓 10mmHg。你懷疑沒那麼多。 H0: μ = 10(或 μ ≥ 10) H1: μ < 10(左尾檢定) 如果你只想知道「有沒有差」但不確定方向: H0: μ = 10, H1: μ ≠ 10(雙尾檢定) 考試陷阱:H0 和 H1 必須涵蓋所有可能。如果 H0 是 μ=10,H1 不能是 μ=15,因為 μ=12 時兩個都不成立。H1 通常是 μ≠10、μ>10 或 μ<10。
- H0 包含等號(=, ≤, ≥),代表「現狀」或「無效果」
- H1 是研究者想證明的方向:≠(雙尾)、>(右尾)、<(左尾)
- H0 和 H1 必須互斥且窮盡所有可能
- 等號放在 H0 是為了在精確假設下計算檢定統計量的分佈
- 先寫假設再看資料——看完資料再選方向會導致多重比較問題
2.第二步:選統計量與參考分配
檢定統計量把「樣本結果離 H0 有多遠」標準化成一個無單位的數字。最常用的兩個: (1) z 統計量:z = (X̄ - μ₀) / (σ/√n)。適用條件:母體標準差 σ 已知,或樣本夠大(n≥30,靠中央極限定理)。z 服從標準常態 N(0,1)。 (2) t 統計量:t = (X̄ - μ₀) / (s/√n)。適用條件:σ 未知,用樣本標準差 s 估計。t 服從自由度 df=n-1 的 t 分佈。n 小時 t 分佈比常態分佈胖(尾巴更重),n 大時趨近常態。 【範例】隨機抽 16 位病患,X̄=8.5, s=3, 檢定 H0: μ=10。 t = (8.5-10)/(3/√16) = (-1.5)/(3/4) = (-1.5)/0.75 = -2.0 df = 16-1 = 15 接下來查 t(15) 的表或用軟體算 p 值。|t|=2.0 在 df=15 時,雙尾 p ≈ 0.064。 選擇原則:σ 已知用 z(實務上很少),σ 未知用 t(最常見)。比例檢定用 z = (p̂-p₀)/√(p₀(1-p₀)/n)。
- z 檢定:σ 已知或 n≥30,z = (X̄-μ₀)/(σ/√n),參考 N(0,1)
- t 檢定:σ 未知用 s 估計,t = (X̄-μ₀)/(s/√n),參考 t(n-1)
- t 分佈比常態胖(n 小時明顯),n→∞ 時 t→z
- 比例檢定用 z = (p̂-p₀)/√(p₀(1-p₀)/n),前提是 np₀ 和 n(1-p₀) 都 ≥ 10
- 分母 σ/√n 或 s/√n 叫做標準誤 (standard error),是估計量的標準差
3.第三步:p 值、臨界值與決策
p 值是「在 H0 為真的前提下,觀察到的統計量或更極端值出現的機率」。它不是「H0 為真的機率」——這是考試最常考的觀念題。 決策規則很簡單:p ≤ α 就拒絕 H0;p > α 就不拒絕 H0。α(顯著水準)是事先設定的誤報容忍度,最常見的是 0.05(5%)。 【範例】接上面的例子,t=-2.0, df=15, 雙尾 p ≈ 0.064。 若 α=0.05:p=0.064 > 0.05,不拒絕 H0。結論:在 5% 顯著水準下,沒有足夠證據認為 μ≠10。 若 α=0.10:p=0.064 < 0.10,拒絕 H0。結論:在 10% 顯著水準下,有證據認為 μ≠10。 同一筆資料,換 α 就換結論——這就是為什麼報告 p 值比只說「顯著/不顯著」更有資訊量。 等價方法:臨界值法。查 t(15) 雙尾 α=0.05 的臨界值 ±2.131。|t|=2.0 < 2.131,未落入拒絕域,不拒絕 H0。和 p 值法結論一致。 注意措辭:不拒絕 H0 ≠ 接受 H0。你只是「證據不夠強」,不是「證明 H0 為真」。
- p 值 = P(觀察到或更極端 | H0 為真),不是 P(H0 為真 | 資料)
- p ≤ α 拒絕 H0,p > α 不拒絕 H0。α 必須在看資料前決定
- 臨界值法等價:|統計量| > 臨界值 → 拒絕;兩種方法結論一定一致
- 「不拒絕 H0」≠「接受 H0」,只代表證據不足以推翻現狀
- α 越小越保守(越不容易拒絕);實務常用 0.05、0.01、0.10
4.第四步:結論、錯誤類型與 Power
結論必須用題目原始語境表達,不能只寫「拒絕 H0」。例如:「在 5% 顯著水準下,有統計證據顯示新藥的平均降壓效果低於宣稱的 10mmHg」。 兩種錯誤: - Type I error (α):H0 為真但你拒絕了它(誤報、false positive)。機率就是 α。 - Type II error (β):H0 為假但你沒拒絕它(漏報、false negative)。機率是 β。 - Power = 1-β:H0 為假時正確拒絕的機率。Power 越高越好。 【影響 Power 的三個因素】 (1) 效果量 (effect size):真實值離 H0 越遠,越容易偵測到差異。 (2) 樣本數 n:n 越大,標準誤越小,統計量越大,Power 越高。 (3) α 水準:α 越大(越願意冒誤報風險),Power 越高。 考試常問:「增加樣本數對 Type I error 有什麼影響?」答案:沒有影響。Type I error = α 是你自己設的,和 n 無關。增加 n 影響的是 Power(降低 Type II error)。 另一個常考陷阱:統計顯著 ≠ 實務重要。p=0.001 不代表效果大,可能只是 n 很大,讓很小的差異也能被偵測到。必須同時看效果量(effect size)和信賴區間。
- 結論用題目語境表達,不只寫統計術語
- Type I error = α(誤報),Type II error = β(漏報),Power = 1-β
- 增加 n 提高 Power 但不改變 α(α 是研究者設定的)
- 統計顯著 ≠ 實務重要:大樣本可以讓微小差異也顯著
- 永遠不要說「證明 H0 為真」或「證明因果關係」
一起拆計算
範例 1:某校宣稱學生平均 GPA ≥ 3.0。隨機抽 25 位學生,X̄=2.85, s=0.5, α=0.05。完成檢定。
- H0: μ ≥ 3.0, H1: μ < 3.0(左尾)
- t = (2.85-3.0)/(0.5/√25) = (-0.15)/0.1 = -1.5
- df = 25-1 = 24
- 查 t(24) 左尾 α=0.05 臨界值 = -1.711
- t=-1.5 > -1.711(未落入拒絕域),不拒絕 H0
- 結論:在 5% 顯著水準下,沒有足夠證據認為平均 GPA 低於 3.0
所以答案是:不拒絕 H0。數據不足以推翻校方宣稱。
範例 2:Type I error rate 是 0.05。如果真實 μ=2.7(H0 為假),Power 是 0.80。問 Type II error rate?增加樣本數後 α 會改變嗎?
- Power = 1-β = 0.80,所以 β = 0.20
- Type II error rate = β = 0.20
- α 是研究者事先設定的門檻,和樣本數 n 無關
- 增加 n 會提高 Power(降低 β),但 α 維持 0.05
所以答案是:β=0.20。增加 n 不改變 α。
這裡最容易算錯
- 把「不拒絕 H0」寫成「接受 H0」:正確說法是「沒有足夠證據拒絕」
- 先看資料再決定 H1 方向:這會膨脹 Type I error
- 把 p 值解讀為「H0 為真的機率」:p 值是「假設 H0 為真時觀察到這樣或更極端結果的機率」
- 認為增加 n 會降低 α:α 是固定的,n 影響的是 Power
- 把顯著關聯直接宣稱為因果關係
換你快速判斷
先口述定義、條件與下一步,再展開答案;公式不是取代條件檢查的捷徑。
1p<α 時的決策?
拒絕 H0
代表資料與 H0 不相容程度達門檻。
2p≥α 能說 H0 已證明嗎?
不能,只能說未能拒絕 H0
檢定不是證明機制。
先完成必要先備
這堂是解歷屆題前的基礎補充,不會為了湊題數硬連不存在的考古題。完成後可回題庫辨識題型。
瀏覽統計學題庫參考來源
- OpenIntro Statistics, Fourth Edition — Diez, Barr, Cetinkaya-Rundel
- NIST/SEMATECH e-Handbook of Statistical Methods — NIST/SEMATECH