內容已複查
32 分鐘 · 2 張概念卡 · 0 題對應考古題

先備:假設檢定是一條決策流程

題面來自台大官方試卷;解答與逐項自評標準(rubric)為本站技術覆核的非官方內容,申論與推導一律採自評。

考古題證據邊界: 這是迴歸 F 檢定與卡方檢定的共同先備,不代表歷屆題涵蓋所有檢定。

第一次接觸也沒關係

這堂先懂這些詞

先記住白話意思,不必急著背英文。看到正文時,再把正式名稱接回來。

虛無假設與對立假設

也會看到:null hypothesis、alternative hypothesis、H0、H₀、H1、H₁

H₀ 讀作「H 零」,是檢定暫時保留的基準說法;H₁ 讀作「H 一」,是資料足夠反對 H₀ 時所支持的方向。

生活例子:
煙霧警報器先以「沒有火災」為 H₀,只有感測訊號夠異常才改採「可能有火災」的 H₁。
別搞混:
未拒絕 H₀ 只代表證據不夠,不等於已經證明 H₀ 正確。

檢定統計量與參考分配

也會看到:test statistic、reference distribution、sampling distribution

檢定統計量把樣本證據濃縮成一個數字,參考分配則告訴我們在 H₀ 成立時這個數字通常會落在哪裡。

生活例子:
警報器把溫度與煙霧濃度濃縮成警戒分數,再拿正常環境下的分數範圍作比較。
別搞混:
不同資料型態與假設條件要用不同統計量和分配,不能看到數字大就一律判為顯著。

顯著水準

也會看到:significance level、α、alpha、α=0.05

顯著水準 α 讀作「alpha」,是分析前設定的拒絕門檻,例如 α=0.05 表示願意承擔至多約 5% 的第一類錯誤風險。

生活例子:
煙霧警報器把門檻調得越嚴格,越不容易誤報,但也可能更容易漏掉真正異常。
別搞混:
α 不是 H₀ 為真的機率,也不該看完 p 值後才為了得到想要的結論而更改。

p 值

也會看到:p-value、p value、p

p 值是在 H₀ 成立的前提下,得到目前這麼極端或更極端資料的機率;p 讀作英文字母「p」。

生活例子:
若正常廚房幾乎不會出現目前這麼高的煙霧讀值,p 值就會很小。
別搞混:
p 值不是 H₀ 為真的機率、不是結果由偶然造成的機率,也不表示效果大小。

統計顯著與未拒絕

也會看到:statistical significance、reject H0、fail to reject H0、p<α

當 p<α(讀作「p 小於 alpha」)時稱結果達統計顯著並拒絕 H₀,否則只能說未能拒絕 H₀。

生活例子:
警報響起代表訊號越過預設門檻,但仍要由人確認是否真的起火及原因為何。
別搞混:
統計顯著不等於效果很大、實務上重要或已證明因果;未顯著也不等於兩者完全沒有差異。

逐項自評標準

也會看到:rubric、評分規準

把完整推導拆成可以逐步核對的要點,幫你找到漏掉的條件或計算步驟。

生活例子:
像算完帳後依序檢查金額、單位、公式與最後結論。
別搞混:
它不是官方配分,也不會把合理但不同的推導方式判成錯誤。

把 H0/H1、統計量、參考分配、p 值與結論串成同一條不跳步的流程。

先抓住這幾件事

  • 寫出正確的 H0/H1 對,並說明為什麼 H0 包含等號
  • 根據資料類型和假設選擇 z 檢定或 t 檢定
  • 用 p 值和顯著水準 α 做出拒絕或不拒絕的決策
  • 區分 Type I 和 Type II 錯誤,解釋 power 的意義

先想像這個場景

煙霧警報器的決策

警報器先假設沒有火災,再看感測訊號是否異常到足以推翻原假設。

先別急著套公式,花十秒想一想:

警報響了,能否直接斷言起火原因?

把故事換成統計語言

生活中的角色對應到統計概念
先假設沒有火災虛無假設 H0
感測器異常程度test statistic
允許的誤報門檻significance level α
警報後的決策reject / fail to reject H0

題目出現這些字,先想到

  • H0/H1
  • α=0.05
  • p-value
  • reject H0

1.第一步:把問題翻譯成假設對

假設檢定從兩個互斥的母體宣稱開始。虛無假設 H0 代表「什麼都沒發生」或「沒有差異」,它一定包含等號(=, ≤, ≥)。對立假設 H1(或 Ha)是你真正想主張的方向。 【為什麼 H0 有等號?】因為我們需要在 H0 為真的精確情境下算出統計量的分佈。如果 H0 是模糊的「μ 可能是任何值」,就無法算 p 值。所以 H0 固定一個基準點,然後看資料離這個基準點有多遠。 【範例】某藥廠宣稱新藥平均降壓 10mmHg。你懷疑沒那麼多。 H0: μ = 10(或 μ ≥ 10) H1: μ < 10(左尾檢定) 如果你只想知道「有沒有差」但不確定方向: H0: μ = 10, H1: μ ≠ 10(雙尾檢定) 考試陷阱:H0 和 H1 必須涵蓋所有可能。如果 H0 是 μ=10,H1 不能是 μ=15,因為 μ=12 時兩個都不成立。H1 通常是 μ≠10、μ>10 或 μ<10。

  • H0 包含等號(=, ≤, ≥),代表「現狀」或「無效果」
  • H1 是研究者想證明的方向:≠(雙尾)、>(右尾)、<(左尾)
  • H0 和 H1 必須互斥且窮盡所有可能
  • 等號放在 H0 是為了在精確假設下計算檢定統計量的分佈
  • 先寫假設再看資料——看完資料再選方向會導致多重比較問題

2.第二步:選統計量與參考分配

檢定統計量把「樣本結果離 H0 有多遠」標準化成一個無單位的數字。最常用的兩個: (1) z 統計量:z = (X̄ - μ₀) / (σ/√n)。適用條件:母體標準差 σ 已知,或樣本夠大(n≥30,靠中央極限定理)。z 服從標準常態 N(0,1)。 (2) t 統計量:t = (X̄ - μ₀) / (s/√n)。適用條件:σ 未知,用樣本標準差 s 估計。t 服從自由度 df=n-1 的 t 分佈。n 小時 t 分佈比常態分佈胖(尾巴更重),n 大時趨近常態。 【範例】隨機抽 16 位病患,X̄=8.5, s=3, 檢定 H0: μ=10。 t = (8.5-10)/(3/√16) = (-1.5)/(3/4) = (-1.5)/0.75 = -2.0 df = 16-1 = 15 接下來查 t(15) 的表或用軟體算 p 值。|t|=2.0 在 df=15 時,雙尾 p ≈ 0.064。 選擇原則:σ 已知用 z(實務上很少),σ 未知用 t(最常見)。比例檢定用 z = (p̂-p₀)/√(p₀(1-p₀)/n)。

  • z 檢定:σ 已知或 n≥30,z = (X̄-μ₀)/(σ/√n),參考 N(0,1)
  • t 檢定:σ 未知用 s 估計,t = (X̄-μ₀)/(s/√n),參考 t(n-1)
  • t 分佈比常態胖(n 小時明顯),n→∞ 時 t→z
  • 比例檢定用 z = (p̂-p₀)/√(p₀(1-p₀)/n),前提是 np₀ 和 n(1-p₀) 都 ≥ 10
  • 分母 σ/√n 或 s/√n 叫做標準誤 (standard error),是估計量的標準差

3.第三步:p 值、臨界值與決策

p 值是「在 H0 為真的前提下,觀察到的統計量或更極端值出現的機率」。它不是「H0 為真的機率」——這是考試最常考的觀念題。 決策規則很簡單:p ≤ α 就拒絕 H0;p > α 就不拒絕 H0。α(顯著水準)是事先設定的誤報容忍度,最常見的是 0.05(5%)。 【範例】接上面的例子,t=-2.0, df=15, 雙尾 p ≈ 0.064。 若 α=0.05:p=0.064 > 0.05,不拒絕 H0。結論:在 5% 顯著水準下,沒有足夠證據認為 μ≠10。 若 α=0.10:p=0.064 < 0.10,拒絕 H0。結論:在 10% 顯著水準下,有證據認為 μ≠10。 同一筆資料,換 α 就換結論——這就是為什麼報告 p 值比只說「顯著/不顯著」更有資訊量。 等價方法:臨界值法。查 t(15) 雙尾 α=0.05 的臨界值 ±2.131。|t|=2.0 < 2.131,未落入拒絕域,不拒絕 H0。和 p 值法結論一致。 注意措辭:不拒絕 H0 ≠ 接受 H0。你只是「證據不夠強」,不是「證明 H0 為真」。

  • p 值 = P(觀察到或更極端 | H0 為真),不是 P(H0 為真 | 資料)
  • p ≤ α 拒絕 H0,p > α 不拒絕 H0。α 必須在看資料前決定
  • 臨界值法等價:|統計量| > 臨界值 → 拒絕;兩種方法結論一定一致
  • 「不拒絕 H0」≠「接受 H0」,只代表證據不足以推翻現狀
  • α 越小越保守(越不容易拒絕);實務常用 0.05、0.01、0.10

4.第四步:結論、錯誤類型與 Power

結論必須用題目原始語境表達,不能只寫「拒絕 H0」。例如:「在 5% 顯著水準下,有統計證據顯示新藥的平均降壓效果低於宣稱的 10mmHg」。 兩種錯誤: - Type I error (α):H0 為真但你拒絕了它(誤報、false positive)。機率就是 α。 - Type II error (β):H0 為假但你沒拒絕它(漏報、false negative)。機率是 β。 - Power = 1-β:H0 為假時正確拒絕的機率。Power 越高越好。 【影響 Power 的三個因素】 (1) 效果量 (effect size):真實值離 H0 越遠,越容易偵測到差異。 (2) 樣本數 n:n 越大,標準誤越小,統計量越大,Power 越高。 (3) α 水準:α 越大(越願意冒誤報風險),Power 越高。 考試常問:「增加樣本數對 Type I error 有什麼影響?」答案:沒有影響。Type I error = α 是你自己設的,和 n 無關。增加 n 影響的是 Power(降低 Type II error)。 另一個常考陷阱:統計顯著 ≠ 實務重要。p=0.001 不代表效果大,可能只是 n 很大,讓很小的差異也能被偵測到。必須同時看效果量(effect size)和信賴區間。

  • 結論用題目語境表達,不只寫統計術語
  • Type I error = α(誤報),Type II error = β(漏報),Power = 1-β
  • 增加 n 提高 Power 但不改變 α(α 是研究者設定的)
  • 統計顯著 ≠ 實務重要:大樣本可以讓微小差異也顯著
  • 永遠不要說「證明 H0 為真」或「證明因果關係」

一起拆計算

範例 1某校宣稱學生平均 GPA ≥ 3.0。隨機抽 25 位學生,X̄=2.85, s=0.5, α=0.05。完成檢定。

  1. H0: μ ≥ 3.0, H1: μ < 3.0(左尾)
  2. t = (2.85-3.0)/(0.5/√25) = (-0.15)/0.1 = -1.5
  3. df = 25-1 = 24
  4. 查 t(24) 左尾 α=0.05 臨界值 = -1.711
  5. t=-1.5 > -1.711(未落入拒絕域),不拒絕 H0
  6. 結論:在 5% 顯著水準下,沒有足夠證據認為平均 GPA 低於 3.0

所以答案是:不拒絕 H0。數據不足以推翻校方宣稱。

範例 2Type I error rate 是 0.05。如果真實 μ=2.7(H0 為假),Power 是 0.80。問 Type II error rate?增加樣本數後 α 會改變嗎?

  1. Power = 1-β = 0.80,所以 β = 0.20
  2. Type II error rate = β = 0.20
  3. α 是研究者事先設定的門檻,和樣本數 n 無關
  4. 增加 n 會提高 Power(降低 β),但 α 維持 0.05

所以答案是:β=0.20。增加 n 不改變 α。

這裡最容易算錯

  • 把「不拒絕 H0」寫成「接受 H0」:正確說法是「沒有足夠證據拒絕」
  • 先看資料再決定 H1 方向:這會膨脹 Type I error
  • 把 p 值解讀為「H0 為真的機率」:p 值是「假設 H0 為真時觀察到這樣或更極端結果的機率」
  • 認為增加 n 會降低 α:α 是固定的,n 影響的是 Power
  • 把顯著關聯直接宣稱為因果關係

換你快速判斷

先口述定義、條件與下一步,再展開答案;公式不是取代條件檢查的捷徑。

1p<α 時的決策?

拒絕 H0

代表資料與 H0 不相容程度達門檻。

2p≥α 能說 H0 已證明嗎?

不能,只能說未能拒絕 H0

檢定不是證明機制。

先完成必要先備

這堂是解歷屆題前的基礎補充,不會為了湊題數硬連不存在的考古題。完成後可回題庫辨識題型。

瀏覽統計學題庫

參考來源