多支有雜訊的溫度計怎麼加權
題面來自台大官方試卷;解答與逐項自評標準(rubric)為本站技術覆核的非官方內容,申論與推導一律採自評。
第一次接觸也沒關係
這堂先懂這些詞
先記住白話意思,不必急著背英文。看到正文時,再把正式名稱接回來。
觀察值與估計量
也會看到:observation、sample、estimator、Yi、Yᵢ、mYᵢ 讀作「Y 下標 i」,表示第 i 筆有隨機性的觀察;估計量則是把多筆觀察依規則合成、用來猜未知母體數值的公式。
- 生活例子:
- 每支溫度計讀值是觀察,把多支讀值平均後得到的數字是估計真實溫度的估計量。
- 別搞混:
- 估計量是抽樣前的計算規則,代入實際資料後得到的單一數字才叫估計值。
不偏估計量
也會看到:unbiased estimator、unbiasedness、E(m)=μ若重複抽樣時估計量的長期平均等於真正參數,就稱不偏;E(m)=μ 讀作「m 的期望值等於 mu」。
- 生活例子:
- 一支秤有時高估、有時低估,但長期平均恰好等於真實重量,可視為不偏。
- 別搞混:
- 不偏不代表每次都準,也不代表它比其他估計量波動更小。
估計權重
也會看到:weights、wi、wᵢ、Σwi=1、weighted meanwᵢ 讀作「w 下標 i」,表示第 i 筆資料占多大比重;Σwᵢ=1 讀作「所有 w 下標 i 的總和等於一」,在各觀察同平均時可讓加權平均維持不偏。
- 生活例子:
- 綜合三支溫度計時給可靠儀器較高權重,但所有採信比例加起來仍是 100%。
- 別搞混:
- 權重和為 1 只處理中心是否偏移,不保證變異數最小,也不保證權重都必須相同。
估計量變異數與效率
也會看到:estimator variance、efficiency、minimum variance、Var(m)=σ²Σwi²估計量變異數衡量答案在重複抽樣間有多晃,在同樣不偏的候選中變異數較小者稱較有效率;Var(m)=σ²Σwᵢ² 讀作「m 的變異數等於 sigma 平方乘權重平方和」。
- 生活例子:
- 兩種溫度合併法都不會長期高估,但每次結果較穩定的那一種效率較高。
- 別搞混:
- 只有在比較條件一致時才能只靠變異數談效率;資料相關或每筆誤差不同時公式也會改變。
最小化、微分與柯西不等式
也會看到:minimize、optimization、derivative、Cauchy、Cauchy–Schwarz inequality、α最小化是在限制下找讓變異數最小的權重,可用微分找谷底或用柯西不等式比較下界;α 讀作「alpha」,在此只是可調權重參數。
- 生活例子:
- 調整兩支溫度計的採信比例,尋找合成讀數晃動最小的位置。
- 別搞混:
- 這裡的 α 是權重參數,不是假設檢定的顯著水準;兩者符號相同但角色不同。
逐項自評標準
也會看到:rubric、評分規準把完整推導拆成可以逐步核對的要點,幫你找到漏掉的條件或計算步驟。
- 生活例子:
- 像算完帳後依序檢查金額、單位、公式與最後結論。
- 別搞混:
- 它不是官方配分,也不會把合理但不同的推導方式判成錯誤。
用 114-5 與 115-4 練習權重和、不偏性、估計量變異數與最小變異權重。
先抓住這幾件事
- 由權重和 Σwi=1 判斷估計量是否為不偏 (unbiased)
- 正確計算加權估計量的變異數(獨立時 Var = σ²Σwi²)
- 用微分法或 Lagrange 乘數找最小變異數的最適權重
- 解釋 relative efficiency 並用 Var 的比值比較兩個估計量
先想像這個場景
合併多支溫度計
每支溫度計都在真實溫度附近晃動,權重代表你多相信哪一支。
先別急著套公式,花十秒想一想:
權重總和為 1 是否已保證波動最小?
把故事換成統計語言
| 生活中的角色 | 對應到 | 統計概念 |
|---|---|---|
| 每支讀值 | iid observations Yi | |
| 採信程度 | weights wi | |
| 刻度不整體偏移 | Σwi=1 使估計量不偏 | |
| 讀數最穩定 | minimize Var(estimator) |
題目出現這些字,先想到
- unbiased estimator
- Σweights=1
- Var(weighted mean)
- efficiency
1.不偏性:期望值命中目標
估計量 (estimator) θ̂ 是用樣本資料計算出的統計量,用來估計母體參數 θ(如 μ, σ², p)。如果 E[θ̂] = θ,我們說 θ̂ 是不偏的 (unbiased)。直覺上,不偏表示「重複抽樣無限次取平均,估計量會剛好命中真實值」。 最常見的加權估計量形式:θ̂ = w1·Y1 + w2·Y2 + ... + wn·Yn,其中 Yi 是 iid 樣本,E[Yi] = μ, Var(Yi) = σ²。 要讓 θ̂ 不偏估計 μ: E[θ̂] = w1·E[Y1] + w2·E[Y2] + ... + wn·E[Yn] = (w1+w2+...+wn)·μ 所以 E[θ̂] = μ 的充要條件是 Σwi = 1。 【範例】樣本平均 Ȳ = (Y1+Y2+...+Yn)/n,每個 wi = 1/n,Σwi = n·(1/n) = 1。✓ 不偏。 反例:θ̂ = (Y1+Y2)/3,Σwi = 2/3 ≠ 1,E[θ̂] = (2/3)μ ≠ μ。✗ 有偏,偏差 bias = -(1/3)μ。 考試陷阱:不偏是對期望值的要求,不是說「每次估計都很準」。一個不偏估計量可能每次都離真值很遠(如果變異數很大),只要平均下來命中就算不偏。好的估計量要同時不偏且低變異數。
- 不偏 (unbiased):E[θ̂] = θ,長期平均命中真值
- 加權估計 μ 的不偏條件:Σwi = 1
- 偏差 bias(θ̂) = E[θ̂] - θ,不偏時 bias = 0
- 樣本平均 Ȳ = ΣYi/n 是 μ 的不偏估計量(wi = 1/n, Σwi = 1)
- 不偏不代表精確——Var 大的不偏估計量可能每次都差很多
θ̂ = (Y1 + Y2) / 3,Yi iid 且 E[Yi] = μ。θ̂ 是 μ 的不偏估計量嗎?
2.估計量變異數:每次估計離期望值多遠
光不偏不夠,我們還要估計量盡量穩定(低變異數)。對加權估計量 θ̂ = Σwi·Yi: 如果 Yi 彼此獨立(Cov=0): Var(θ̂) = w1²·Var(Y1) + w2²·Var(Y2) + ... + wn²·Var(Yn) 如果 Yi 是 iid(獨立同分佈,Var(Yi) = σ²): Var(θ̂) = σ²·(w1² + w2² + ... + wn²) = σ²·Σwi² 【範例】Ȳ = ΣYi/n,每個 wi = 1/n: Var(Ȳ) = σ²·Σ(1/n)² = σ²·n·(1/n²) = σ²/n n 越大,Var(Ȳ) 越小——這就是為什麼大樣本的平均值更可靠。 【反例】θ̂ = Y1(只用第一個觀測值,w1=1, 其他 wi=0): Var(θ̂) = σ²·1² = σ² 比較:Var(Ȳ) = σ²/n ≤ σ² = Var(Y1),所以 Ȳ 比 Y1 穩定(n≥1 時)。 考試陷阱:Var(θ̂) 的公式裡是 wi²(權重平方),不是 wi。很多學生漏掉平方。另一個常見錯誤是沒確認獨立就直接用 σ²·Σwi²——如果 Yi 不獨立,要加入 covariance 項:Var(θ̂) = σ²·Σwi² + 2σ²·Σ_{i<j} wi·wj·ρ,其中 ρ 是相關係數。
- iid 加權:Var(θ̂) = σ²·Σwi²,關鍵是權重要平方
- 樣本平均:Var(Ȳ) = σ²/n,n 越大越穩定
- 不獨立時要加 Cov 項:Var = σ²·Σwi² + 2·Σ_{i<j} wi·wj·Cov(Yi,Yj)
- Σwi² 可用 Cauchy-Schwarz 不等式得下界:Σwi² ≥ (Σwi)²/n = 1/n
- 等權重 wi=1/n 使 Σwi² 最小 = 1/n → Var(Ȳ) = σ²/n 是所有等 σ² 不偏估計中最小的
拉拉看:調整三個權重,觀察 Σwi² 如何變化
把 w₁ 調到 1.00、w₂ 和 w₃ 都調到 0,Σwi² 變多少?這代表什麼?
3.最適權重:用微分找最小變異數
問題:在 Σwi=1(不偏)的限制下,選什麼權重讓 Var(θ̂) = σ²·Σwi² 最小? 方法一:Lagrange 乘數法。 目標:min Σwi² subject to Σwi=1。 L = Σwi² - λ(Σwi - 1) ∂L/∂wi = 2wi - λ = 0 → wi = λ/2(所有 i 一樣) 代入限制:n·(λ/2) = 1 → λ = 2/n → wi = 1/n 結論:iid 情形下,等權重是最佳選擇,最小 Var = σ²/n。 方法二:兩變數直接微分。 如果只有 Y1, Y2,θ̂ = w·Y1 + (1-w)·Y2(自動滿足 Σwi=1)。 Var = σ²·[w² + (1-w)²] = σ²·(2w²-2w+1) 令 dVar/dw = σ²·(4w-2) = 0 → w = 1/2 Var_min = σ²·(1/4+1/4) = σ²/2 ✓ 114 年考題的變化型:權重不是簡單的 wi,而是 g(i)/Σg(i) 的形式,需要先展開 g 函數再計算 Σg² 和 Σg。 【非等 σ² 情形】如果 Var(Yi) = σi²(各不相同),最適權重為 wi ∝ 1/σi²(對變異數大的觀測值給小權重)。直覺:越不穩定的溫度計越不該相信。
- iid 等 σ²:最適權重 = 等權重 wi=1/n,Var_min = σ²/n
- Lagrange 法:min Σwi² s.t. Σwi=1 → wi = 1/n
- 兩變數快捷:θ̂ = wY1+(1-w)Y2,微分 dVar/dw=0 解 w
- 非等 σ²:wi ∝ 1/σi²(精度加權),越穩定的觀測給越大權重
- 最適權重不一定是等權重——只有 iid 時才恰好是
θ̂ = w·Y₁ + (1-w)·Y₂,兩筆 iid 觀測。最小變異數的 w 是多少?
如果 Var(Y₁) = 4, Var(Y₂) = 9(不同變異數),最適 w 會:
4.效率與相對效率:比較兩個估計量
Relative Efficiency (RE) 用來比較兩個不偏估計量的優劣: RE(θ̂1, θ̂2) = Var(θ̂2) / Var(θ̂1) 如果 RE > 1,表示 θ̂1 的變異數比較小(更有效率)。如果 RE = 2,表示 θ̂2 的波動是 θ̂1 的兩倍——用 θ̂2 需要兩倍的樣本量才能達到和 θ̂1 一樣的精確度。 【範例】θ̂1 = Ȳ = ΣYi/n, Var(θ̂1) = σ²/n。 θ̂2 = Y1(只用第一筆), Var(θ̂2) = σ²。 RE(Ȳ, Y1) = σ² / (σ²/n) = n。 也就是說,用全部樣本的平均比只用一筆效率高 n 倍。 【進階觀念】Cramér-Rao Lower Bound (CRLB) 是不偏估計量變異數的理論下界。如果某個估計量的 Var 恰好等於 CRLB,它就是 UMVUE (Uniformly Minimum Variance Unbiased Estimator),不可能再更好了。考試通常不要求推導 CRLB,但會問「什麼是有效估計量」或「為什麼 Ȳ 是 UMVUE」。 考試陷阱:RE 的分子分母不要搞反。慣例是 RE(θ̂1, θ̂2) = Var(θ̂2)/Var(θ̂1),但有些教材反過來,看清題目定義。另外,efficiency 只在兩者都不偏時才有意義——如果其中一個有偏,不能直接比 Var。
- RE(θ̂1, θ̂2) = Var(θ̂2)/Var(θ̂1),RE>1 表示 θ̂1 更好
- RE = n 表示效率差 n 倍——用差的估計量需要 n 倍樣本
- CRLB 是不偏估計量 Var 的下界,達到 CRLB 的叫 efficient estimator
- 樣本平均 Ȳ 在常態母體下是 μ 的 UMVUE
- RE 只在兩者都不偏時有意義,有偏估計量要用 MSE = Var + Bias² 比較
θ̂₁ = Ȳ (n=10), θ̂₂ = Y₁。RE(θ̂₁, θ̂₂) = ?
一起拆計算
範例 1:Y1, Y2, ..., Y5 iid, E[Yi]=μ, Var(Yi)=σ²。比較 θ̂1=Ȳ 和 θ̂2=(2Y1+3Y2)/(5) 的不偏性和效率。
- θ̂1: Σwi = 5·(1/5) = 1 ✓ 不偏。Var = σ²/5
- θ̂2: w1=2/5, w2=3/5,Σwi = 2/5+3/5 = 1 ✓ 不偏(但只用了 2 筆)
- Var(θ̂2) = σ²·((2/5)²+(3/5)²) = σ²·(4/25+9/25) = σ²·(13/25)
- RE(θ̂1, θ̂2) = Var(θ̂2)/Var(θ̂1) = (13σ²/25)/(σ²/5) = (13/25)·5 = 13/5 = 2.6
- θ̂1 效率是 θ̂2 的 2.6 倍
所以答案是:兩者都不偏。Var(θ̂1)=σ²/5, Var(θ̂2)=13σ²/25。RE=2.6,Ȳ 更有效率。
範例 2:θ̂ = wY1 + (1-w)Y2。Var(Y1)=4, Var(Y2)=9,獨立。找使 Var(θ̂) 最小的 w。
- 不偏:w+(1-w)=1 ✓ 自動滿足
- Var(θ̂) = w²·4 + (1-w)²·9 = 4w² + 9(1-2w+w²) = 13w² - 18w + 9
- dVar/dw = 26w - 18 = 0 → w = 18/26 = 9/13 ≈ 0.692
- 1-w = 4/13 ≈ 0.308
- Var_min = 13·(9/13)² - 18·(9/13) + 9 = 81/13 - 162/13 + 117/13 = 36/13 ≈ 2.769
- 驗證:wi ∝ 1/σi² → w1 ∝ 1/4=0.25, w2 ∝ 1/9≈0.111 → w1 = 0.25/(0.25+0.111) = 9/13 ✓
所以答案是:w = 9/13, Var_min = 36/13 ≈ 2.77。精度高的(σ²=4)給大權重。
這裡最容易算錯
- 把原卷分母看成 T 而非實際觀測數:仔細看 Σg(i) 代表什麼
- 權重和為 1 就誤認一定最有效率:效率還要看 Σwi²,等權重只在 iid 等 σ² 時最佳
- 漏掉權重平方:Var = σ²·Σwi²,不是 σ²·Σwi
- 非等變異數時用等權重:最適權重是 wi ∝ 1/σi²
- 把 relative efficiency 分子分母搞反:RE(好的, 差的) > 1
換你快速判斷
先口述定義、條件與下一步,再展開答案;公式不是取代條件檢查的捷徑。
1iid 平均數 μ 的線性估計量何時不偏?
權重和等於 1
E(ΣwiYi)=μΣwi。
2不偏是否保證最小變異數?
不保證
不偏只約束中心,不約束波動。
3獨立同變異 Yi 的加權和變異數?
σ²Σwi²
獨立使 covariance 項為 0。
4114-5 的 g 循環為 2,3,4,5,1,Σg²?
11T
每五項平方和 55,共 T/5 組。
5iid 等變異且權重和固定時,何者通常最穩?
等權重平均
平方和在等權重時最小。
6觀測彼此相關時,變異數還能只加 wi²σ² 嗎?
不能,需加入 covariance
這是溫度計比喻的邊界。
最後用考古題自評
請先在紙上完成推導,再依非官方解析與逐項自評標準檢查;本流程不產生虛假的 A–E 分數。
開始本課考古題自評參考來源
- 114 學年度台大資管所招生筆試原卷 — 國立臺灣大學
- 115 學年度台大資管所招生筆試原卷 — 國立臺灣大學
- STAT 415: Introduction to Mathematical Statistics — Penn State Department of Statistics