內容已複查
45 分鐘 · 6 張概念卡 · 2 題對應考古題

多支有雜訊的溫度計怎麼加權

題面來自台大官方試卷;解答與逐項自評標準(rubric)為本站技術覆核的非官方內容,申論與推導一律採自評。

第一次接觸也沒關係

這堂先懂這些詞

先記住白話意思,不必急著背英文。看到正文時,再把正式名稱接回來。

觀察值與估計量

也會看到:observation、sample、estimator、Yi、Yᵢ、m

Yᵢ 讀作「Y 下標 i」,表示第 i 筆有隨機性的觀察;估計量則是把多筆觀察依規則合成、用來猜未知母體數值的公式。

生活例子:
每支溫度計讀值是觀察,把多支讀值平均後得到的數字是估計真實溫度的估計量。
別搞混:
估計量是抽樣前的計算規則,代入實際資料後得到的單一數字才叫估計值。

不偏估計量

也會看到:unbiased estimator、unbiasedness、E(m)=μ

若重複抽樣時估計量的長期平均等於真正參數,就稱不偏;E(m)=μ 讀作「m 的期望值等於 mu」。

生活例子:
一支秤有時高估、有時低估,但長期平均恰好等於真實重量,可視為不偏。
別搞混:
不偏不代表每次都準,也不代表它比其他估計量波動更小。

估計權重

也會看到:weights、wi、wᵢ、Σwi=1、weighted mean

wᵢ 讀作「w 下標 i」,表示第 i 筆資料占多大比重;Σwᵢ=1 讀作「所有 w 下標 i 的總和等於一」,在各觀察同平均時可讓加權平均維持不偏。

生活例子:
綜合三支溫度計時給可靠儀器較高權重,但所有採信比例加起來仍是 100%。
別搞混:
權重和為 1 只處理中心是否偏移,不保證變異數最小,也不保證權重都必須相同。

估計量變異數與效率

也會看到:estimator variance、efficiency、minimum variance、Var(m)=σ²Σwi²

估計量變異數衡量答案在重複抽樣間有多晃,在同樣不偏的候選中變異數較小者稱較有效率;Var(m)=σ²Σwᵢ² 讀作「m 的變異數等於 sigma 平方乘權重平方和」。

生活例子:
兩種溫度合併法都不會長期高估,但每次結果較穩定的那一種效率較高。
別搞混:
只有在比較條件一致時才能只靠變異數談效率;資料相關或每筆誤差不同時公式也會改變。

最小化、微分與柯西不等式

也會看到:minimize、optimization、derivative、Cauchy、Cauchy–Schwarz inequality、α

最小化是在限制下找讓變異數最小的權重,可用微分找谷底或用柯西不等式比較下界;α 讀作「alpha」,在此只是可調權重參數。

生活例子:
調整兩支溫度計的採信比例,尋找合成讀數晃動最小的位置。
別搞混:
這裡的 α 是權重參數,不是假設檢定的顯著水準;兩者符號相同但角色不同。

逐項自評標準

也會看到:rubric、評分規準

把完整推導拆成可以逐步核對的要點,幫你找到漏掉的條件或計算步驟。

生活例子:
像算完帳後依序檢查金額、單位、公式與最後結論。
別搞混:
它不是官方配分,也不會把合理但不同的推導方式判成錯誤。

用 114-5 與 115-4 練習權重和、不偏性、估計量變異數與最小變異權重。

先抓住這幾件事

  • 由權重和 Σwi=1 判斷估計量是否為不偏 (unbiased)
  • 正確計算加權估計量的變異數(獨立時 Var = σ²Σwi²)
  • 用微分法或 Lagrange 乘數找最小變異數的最適權重
  • 解釋 relative efficiency 並用 Var 的比值比較兩個估計量

先想像這個場景

合併多支溫度計

每支溫度計都在真實溫度附近晃動,權重代表你多相信哪一支。

先別急著套公式,花十秒想一想:

權重總和為 1 是否已保證波動最小?

把故事換成統計語言

生活中的角色對應到統計概念
每支讀值iid observations Yi
採信程度weights wi
刻度不整體偏移Σwi=1 使估計量不偏
讀數最穩定minimize Var(estimator)

題目出現這些字,先想到

  • unbiased estimator
  • Σweights=1
  • Var(weighted mean)
  • efficiency

1.不偏性:期望值命中目標

估計量 (estimator) θ̂ 是用樣本資料計算出的統計量,用來估計母體參數 θ(如 μ, σ², p)。如果 E[θ̂] = θ,我們說 θ̂ 是不偏的 (unbiased)。直覺上,不偏表示「重複抽樣無限次取平均,估計量會剛好命中真實值」。 最常見的加權估計量形式:θ̂ = w1·Y1 + w2·Y2 + ... + wn·Yn,其中 Yi 是 iid 樣本,E[Yi] = μ, Var(Yi) = σ²。 要讓 θ̂ 不偏估計 μ: E[θ̂] = w1·E[Y1] + w2·E[Y2] + ... + wn·E[Yn] = (w1+w2+...+wn)·μ 所以 E[θ̂] = μ 的充要條件是 Σwi = 1。 【範例】樣本平均 Ȳ = (Y1+Y2+...+Yn)/n,每個 wi = 1/n,Σwi = n·(1/n) = 1。✓ 不偏。 反例:θ̂ = (Y1+Y2)/3,Σwi = 2/3 ≠ 1,E[θ̂] = (2/3)μ ≠ μ。✗ 有偏,偏差 bias = -(1/3)μ。 考試陷阱:不偏是對期望值的要求,不是說「每次估計都很準」。一個不偏估計量可能每次都離真值很遠(如果變異數很大),只要平均下來命中就算不偏。好的估計量要同時不偏且低變異數。

  • 不偏 (unbiased):E[θ̂] = θ,長期平均命中真值
  • 加權估計 μ 的不偏條件:Σwi = 1
  • 偏差 bias(θ̂) = E[θ̂] - θ,不偏時 bias = 0
  • 樣本平均 Ȳ = ΣYi/n 是 μ 的不偏估計量(wi = 1/n, Σwi = 1)
  • 不偏不代表精確——Var 大的不偏估計量可能每次都差很多

θ̂ = (Y1 + Y2) / 3,Yi iid 且 E[Yi] = μ。θ̂ 是 μ 的不偏估計量嗎?

2.估計量變異數:每次估計離期望值多遠

光不偏不夠,我們還要估計量盡量穩定(低變異數)。對加權估計量 θ̂ = Σwi·Yi: 如果 Yi 彼此獨立(Cov=0): Var(θ̂) = w1²·Var(Y1) + w2²·Var(Y2) + ... + wn²·Var(Yn) 如果 Yi 是 iid(獨立同分佈,Var(Yi) = σ²): Var(θ̂) = σ²·(w1² + w2² + ... + wn²) = σ²·Σwi² 【範例】Ȳ = ΣYi/n,每個 wi = 1/n: Var(Ȳ) = σ²·Σ(1/n)² = σ²·n·(1/n²) = σ²/n n 越大,Var(Ȳ) 越小——這就是為什麼大樣本的平均值更可靠。 【反例】θ̂ = Y1(只用第一個觀測值,w1=1, 其他 wi=0): Var(θ̂) = σ²·1² = σ² 比較:Var(Ȳ) = σ²/n ≤ σ² = Var(Y1),所以 Ȳ 比 Y1 穩定(n≥1 時)。 考試陷阱:Var(θ̂) 的公式裡是 wi²(權重平方),不是 wi。很多學生漏掉平方。另一個常見錯誤是沒確認獨立就直接用 σ²·Σwi²——如果 Yi 不獨立,要加入 covariance 項:Var(θ̂) = σ²·Σwi² + 2σ²·Σ_{i<j} wi·wj·ρ,其中 ρ 是相關係數。

  • iid 加權:Var(θ̂) = σ²·Σwi²,關鍵是權重要平方
  • 樣本平均:Var(Ȳ) = σ²/n,n 越大越穩定
  • 不獨立時要加 Cov 項:Var = σ²·Σwi² + 2·Σ_{i<j} wi·wj·Cov(Yi,Yj)
  • Σwi² 可用 Cauchy-Schwarz 不等式得下界:Σwi² ≥ (Σwi)²/n = 1/n
  • 等權重 wi=1/n 使 Σwi² 最小 = 1/n → Var(Ȳ) = σ²/n 是所有等 σ² 不偏估計中最小的

拉拉看:調整三個權重,觀察 Σwi² 如何變化

0.33
0.33
0.34
Σwi² =

把 w₁ 調到 1.00、w₂ 和 w₃ 都調到 0,Σwi² 變多少?這代表什麼?

3.最適權重:用微分找最小變異數

問題:在 Σwi=1(不偏)的限制下,選什麼權重讓 Var(θ̂) = σ²·Σwi² 最小? 方法一:Lagrange 乘數法。 目標:min Σwi² subject to Σwi=1。 L = Σwi² - λ(Σwi - 1) ∂L/∂wi = 2wi - λ = 0 → wi = λ/2(所有 i 一樣) 代入限制:n·(λ/2) = 1 → λ = 2/n → wi = 1/n 結論:iid 情形下,等權重是最佳選擇,最小 Var = σ²/n。 方法二:兩變數直接微分。 如果只有 Y1, Y2,θ̂ = w·Y1 + (1-w)·Y2(自動滿足 Σwi=1)。 Var = σ²·[w² + (1-w)²] = σ²·(2w²-2w+1) 令 dVar/dw = σ²·(4w-2) = 0 → w = 1/2 Var_min = σ²·(1/4+1/4) = σ²/2 ✓ 114 年考題的變化型:權重不是簡單的 wi,而是 g(i)/Σg(i) 的形式,需要先展開 g 函數再計算 Σg² 和 Σg。 【非等 σ² 情形】如果 Var(Yi) = σi²(各不相同),最適權重為 wi ∝ 1/σi²(對變異數大的觀測值給小權重)。直覺:越不穩定的溫度計越不該相信。

  • iid 等 σ²:最適權重 = 等權重 wi=1/n,Var_min = σ²/n
  • Lagrange 法:min Σwi² s.t. Σwi=1 → wi = 1/n
  • 兩變數快捷:θ̂ = wY1+(1-w)Y2,微分 dVar/dw=0 解 w
  • 非等 σ²:wi ∝ 1/σi²(精度加權),越穩定的觀測給越大權重
  • 最適權重不一定是等權重——只有 iid 時才恰好是

θ̂ = w·Y₁ + (1-w)·Y₂,兩筆 iid 觀測。最小變異數的 w 是多少?

如果 Var(Y₁) = 4, Var(Y₂) = 9(不同變異數),最適 w 會:

4.效率與相對效率:比較兩個估計量

Relative Efficiency (RE) 用來比較兩個不偏估計量的優劣: RE(θ̂1, θ̂2) = Var(θ̂2) / Var(θ̂1) 如果 RE > 1,表示 θ̂1 的變異數比較小(更有效率)。如果 RE = 2,表示 θ̂2 的波動是 θ̂1 的兩倍——用 θ̂2 需要兩倍的樣本量才能達到和 θ̂1 一樣的精確度。 【範例】θ̂1 = Ȳ = ΣYi/n, Var(θ̂1) = σ²/n。 θ̂2 = Y1(只用第一筆), Var(θ̂2) = σ²。 RE(Ȳ, Y1) = σ² / (σ²/n) = n。 也就是說,用全部樣本的平均比只用一筆效率高 n 倍。 【進階觀念】Cramér-Rao Lower Bound (CRLB) 是不偏估計量變異數的理論下界。如果某個估計量的 Var 恰好等於 CRLB,它就是 UMVUE (Uniformly Minimum Variance Unbiased Estimator),不可能再更好了。考試通常不要求推導 CRLB,但會問「什麼是有效估計量」或「為什麼 Ȳ 是 UMVUE」。 考試陷阱:RE 的分子分母不要搞反。慣例是 RE(θ̂1, θ̂2) = Var(θ̂2)/Var(θ̂1),但有些教材反過來,看清題目定義。另外,efficiency 只在兩者都不偏時才有意義——如果其中一個有偏,不能直接比 Var。

  • RE(θ̂1, θ̂2) = Var(θ̂2)/Var(θ̂1),RE>1 表示 θ̂1 更好
  • RE = n 表示效率差 n 倍——用差的估計量需要 n 倍樣本
  • CRLB 是不偏估計量 Var 的下界,達到 CRLB 的叫 efficient estimator
  • 樣本平均 Ȳ 在常態母體下是 μ 的 UMVUE
  • RE 只在兩者都不偏時有意義,有偏估計量要用 MSE = Var + Bias² 比較

θ̂₁ = Ȳ (n=10), θ̂₂ = Y₁。RE(θ̂₁, θ̂₂) = ?

一起拆計算

範例 1Y1, Y2, ..., Y5 iid, E[Yi]=μ, Var(Yi)=σ²。比較 θ̂1=Ȳ 和 θ̂2=(2Y1+3Y2)/(5) 的不偏性和效率。

  1. θ̂1: Σwi = 5·(1/5) = 1 ✓ 不偏。Var = σ²/5
  2. θ̂2: w1=2/5, w2=3/5,Σwi = 2/5+3/5 = 1 ✓ 不偏(但只用了 2 筆)
  3. Var(θ̂2) = σ²·((2/5)²+(3/5)²) = σ²·(4/25+9/25) = σ²·(13/25)
  4. RE(θ̂1, θ̂2) = Var(θ̂2)/Var(θ̂1) = (13σ²/25)/(σ²/5) = (13/25)·5 = 13/5 = 2.6
  5. θ̂1 效率是 θ̂2 的 2.6 倍

所以答案是:兩者都不偏。Var(θ̂1)=σ²/5, Var(θ̂2)=13σ²/25。RE=2.6,Ȳ 更有效率。

範例 2θ̂ = wY1 + (1-w)Y2。Var(Y1)=4, Var(Y2)=9,獨立。找使 Var(θ̂) 最小的 w。

  1. 不偏:w+(1-w)=1 ✓ 自動滿足
  2. Var(θ̂) = w²·4 + (1-w)²·9 = 4w² + 9(1-2w+w²) = 13w² - 18w + 9
  3. dVar/dw = 26w - 18 = 0 → w = 18/26 = 9/13 ≈ 0.692
  4. 1-w = 4/13 ≈ 0.308
  5. Var_min = 13·(9/13)² - 18·(9/13) + 9 = 81/13 - 162/13 + 117/13 = 36/13 ≈ 2.769
  6. 驗證:wi ∝ 1/σi² → w1 ∝ 1/4=0.25, w2 ∝ 1/9≈0.111 → w1 = 0.25/(0.25+0.111) = 9/13 ✓

所以答案是:w = 9/13, Var_min = 36/13 ≈ 2.77。精度高的(σ²=4)給大權重。

這裡最容易算錯

  • 把原卷分母看成 T 而非實際觀測數:仔細看 Σg(i) 代表什麼
  • 權重和為 1 就誤認一定最有效率:效率還要看 Σwi²,等權重只在 iid 等 σ² 時最佳
  • 漏掉權重平方:Var = σ²·Σwi²,不是 σ²·Σwi
  • 非等變異數時用等權重:最適權重是 wi ∝ 1/σi²
  • 把 relative efficiency 分子分母搞反:RE(好的, 差的) > 1

換你快速判斷

先口述定義、條件與下一步,再展開答案;公式不是取代條件檢查的捷徑。

1iid 平均數 μ 的線性估計量何時不偏?

權重和等於 1

E(ΣwiYi)=μΣwi。

2不偏是否保證最小變異數?

不保證

不偏只約束中心,不約束波動。

3獨立同變異 Yi 的加權和變異數?

σ²Σwi²

獨立使 covariance 項為 0。

4114-5 的 g 循環為 2,3,4,5,1,Σg²?

11T

每五項平方和 55,共 T/5 組。

5iid 等變異且權重和固定時,何者通常最穩?

等權重平均

平方和在等權重時最小。

6觀測彼此相關時,變異數還能只加 wi²σ² 嗎?

不能,需加入 covariance

這是溫度計比喻的邊界。

最後用考古題自評

請先在紙上完成推導,再依非官方解析與逐項自評標準檢查;本流程不產生虛假的 A–E 分數。

開始本課考古題自評

參考來源