內容已複查
34 分鐘 · 0 張概念卡 · 3 題對應考古題

模型評估、公平性與漂移:為什麼準確率不夠用

題面來自台大官方試卷;解析與逐項自評標準(rubric)為本站依已複查來源整理的非官方內容,策略申論容許有條件且有證據的替代論點。

考古題證據邊界: 考古題只證明此範圍曾出現;題面均為申論或開放題,答案非官方,課程練習採 rubric self-review,絕不進自動計分或完整模擬考。

第一次接觸也沒關係

這堂先懂這些詞

先記住白話意思,不必急著背英文。看到正文時,再把正式名稱接回來。

機器學習使用情境

也會看到:ML use case、AI use case、機器學習

明確說明模型要幫誰做哪個決策,以及錯了會造成什麼影響。

生活例子:
預測明天備多少便當,而不是籠統說導入 AI。
別搞混:
模型功能不是完整 use case;還要有人、流程與結果。

資料洩漏

也會看到:data leakage、leakage control

訓練時偷看到實際部署時不可能取得的答案或未來資訊。

生活例子:
用是否已退貨去預測下單當下會不會退貨。
別搞混:
不只是個資外洩;這裡指模型評估被答案或未來資訊污染。

資料漂移/概念漂移

也會看到:data drift、concept drift

前者是輸入資料分布改變;後者是輸入與正確答案的關係改變。

生活例子:
顧客年齡層改變是資料漂移;同樣購物行為不再代表會續訂是概念漂移。
別搞混:
兩者可分別發生,資料漂移不必然讓模型失效。

AI 可信賴性

也會看到:trustworthiness、trustworthy AI

AI 在準確、安全、公平、隱私、透明與可問責等面向值得依賴的程度。

生活例子:
貸款模型除了準確,還要能申訴、保護資料並監測歧視。
別搞混:
不等於使用者主觀相信品牌,也不是單一分數。

深入模型評估的多面向考量:從離線指標到線上表現、從整體準確率到子群體公平、從部署時的表現到隨時間漂移的衰退。

先抓住這幾件事

  • 設計完整的模型評估流程(train/val/test split、cross-validation、leakage prevention)
  • 解釋 fairness 的多種定義及其不可兼得性(impossibility theorem)
  • 區分 data drift 與 concept drift 並設計監控機制
  • 評估 A/B test 與 shadow deployment 在模型更新中的角色

1.評估流程的正確順序

模型評估的正確流程始於資料分割(data split),目的是防止資訊洩漏(information leakage)。Train set 用於訓練模型參數,validation set 用於選擇超參數和模型架構(例如比較 Random Forest 和 Gradient Boosting 哪個更好),test set 只在最終評估時使用一次——它代表「模型從未見過的真實世界資料」。 最常見的評估錯誤是把 test set 當成 validation set 反覆使用——每次調完參數就用 test set 看效果,這等於把 test set 的資訊洩漏進了模型選擇過程,導致離線評估過度樂觀。上線後效果不如預期就是因為這個。時間序列資料不能隨機切分(random split),必須用 time-based split(用過去的資料預測未來),否則模型會「看到未來」。 Cross-validation(交叉驗證)在資料量小的時候替代固定的 validation set:把資料分成 k 份,輪流用 k-1 份訓練、1 份驗證,取 k 次結果的平均。但在時間序列中不能隨機做 k-fold——要用 rolling-window 或 expanding-window 方法。 線上指標和離線指標可能差異顯著:模型離線 AUC 0.95 但上線後轉化率沒有提升,可能原因包括 training-serving skew(訓練用的特徵和線上推論用的特徵計算方式不同)、feedback loop(模型決策改變了使用者行為,導致新資料的分布與訓練資料不同)、novelty effect(使用者初期對新推薦感到新鮮,效果消退後回歸基線)。

  • Train/validation/test 三分法的核心是防止資訊洩漏——test set 只用一次
  • 反覆用 test set 調參等於把它變成 validation set,離線評估會過度樂觀
  • 時間序列不能 random split——必須用 time-based split 避免「看到未來」
  • Cross-validation 適合小資料量,但時間序列要用 rolling/expanding window
  • 離線好線上差的三大原因:training-serving skew、feedback loop、novelty effect

2.單一指標無法捕捉模型品質

Accuracy 是最常被誤用的指標。在不平衡資料集中(例如 99% 正常交易、1% 詐騙),一個「全部預測為正常」的模型 accuracy 就是 99%,但它完全無法偵測詐騙——recall 是 0%。所以不平衡場景下 accuracy 幾乎無用。 正確的指標選擇取決於業務問題:Precision(查準率)= TP/(TP+FP),回答「模型說是詐騙的裡面,真的是詐騙的有多少?」——precision 高代表誤報少。Recall(查全率)= TP/(TP+FN),回答「所有真正的詐騙裡面,模型找到了多少?」——recall 高代表漏檢少。F1-score = precision 和 recall 的調和平均。 業務脈絡決定取捨:詐騙偵測優先 recall(寧可多查幾個正常交易,也不能漏掉大額詐騙)。垃圾郵件過濾優先 precision(寧可放過幾封垃圾郵件,也不能誤殺重要信件)。兩者的 trade-off 由 decision threshold(決策閾值)控制——調高閾值 precision 上升 recall 下降,反之亦然。 AUC-ROC 衡量模型在所有 threshold 下的綜合排序能力。Calibration 衡量預測機率與實際機率的一致性——一個模型預測「80% 機率是詐騙」,實際應該有大約 80% 的案例真的是詐騙。Calibration 差的模型即使 AUC 高,也不適合直接用預測機率做決策。 但最終判斷還是業務指標:轉化率有沒有提升?退貨率有沒有降低?客訴量有沒有減少?離線的 ML 指標只是中間指標。

  • 不平衡資料中 accuracy 幾乎無用——全猜多數類就能達到高 accuracy
  • Precision(誤報少)vs Recall(漏檢少)的取捨由業務脈絡決定
  • AUC-ROC 衡量綜合排序能力,Calibration 衡量預測機率的可信度
  • Decision threshold 控制 precision-recall trade-off——不是模型決定,是人類決定
  • 離線 ML 指標是中間指標——最終判斷看業務指標(轉化率、退貨率、客訴量)

3.公平性沒有唯一定義

AI 公平性(fairness)是近年台大 MIS 考題的重要議題。核心困難在於:公平性有多種數學定義,而且它們在數學上不可能同時滿足(Chouldechova/Kleinberg impossibility theorem)。 三種主要定義:Demographic parity(人口統計均等)——不同群體獲得正面結果的比例應該相同(例如男女的貸款核准率應該一樣)。Equalized odds(均等化勝算)——不同群體的 True Positive Rate 和 False Positive Rate 應該相同(例如男女中,真正有能力還款的人被核准的比例應該一樣)。Individual fairness(個體公平)——相似的個體應該得到相似的結果(例如收入、信用歷史、負債比相近的兩個人,不論性別,應該得到相同的貸款決策)。 Impossibility theorem 指出:除非各群體的基礎率(base rate)完全相同,否則 demographic parity 和 equalized odds 不可能同時滿足。這意味著「選擇哪個公平性定義」不是技術問題,而是價值判斷——不同的利害關係人可能偏好不同的定義。 技術手段也有限制:移除 sensitive features(如性別、種族)不代表消除偏見——因為其他特徵(如郵遞區號、學校名稱)可能是 proxy variables(代理變數),間接攜帶相同的資訊。歷史資料反映歷史偏見,模型會學到並放大這些偏見。 考試常見:給一個 AI 決策案例,分析公平性問題並提出改善建議。好的答案要指出用哪個公平性定義、為什麼選這個、以及選擇帶來的 trade-off。

  • 三種公平性定義:demographic parity(結果比例相同)、equalized odds(TPR/FPR 相同)、individual fairness(相似個體相似結果)
  • Impossibility theorem:除非群體基礎率相同,demographic parity 和 equalized odds 不可能同時滿足
  • 選擇哪個定義是價值判斷,不是技術問題——不同利害關係人偏好不同
  • 移除 sensitive features 不消除偏見——proxy variables 間接攜帶相同資訊
  • 歷史資料反映歷史偏見——模型會學到並放大,不能假設資料是中性的

4.部署後模型會老化

模型部署後會老化——這是 AI 系統與傳統軟體最大的差異。傳統軟體部署後行為是確定的(同樣的輸入產生同樣的輸出),但 AI 模型的行為取決於輸入資料的分布,當分布改變了,模型的預測品質就會下降。 Data drift(資料漂移)指輸入資料的分布改變了。例如:電商推薦模型在雙 11 期間的使用者行為分布與平時完全不同。Concept drift(概念漂移)指輸入與輸出之間的關係改變了。例如:COVID-19 之後,「家庭收入」和「旅遊支出」之間的關係完全改變(高收入不再意味著高旅遊支出)。Data drift 不必然導致 concept drift,但兩者都需要監控。 監控的三個層面:(1) 輸入統計量——用 PSI(Population Stability Index)或 KS-test 比較生產資料與訓練資料的分布差異。PSI > 0.1 通常表示輕微漂移,> 0.25 表示顯著漂移。(2) 預測品質——如果有 ground truth(事後可以知道真實結果),直接追蹤 precision/recall 的趨勢。如果沒有(例如推薦系統的長期效果),用 proxy metric 和定期人工抽樣。(3) 系統指標——延遲、吞吐量、錯誤率、資源使用率。 新模型上線的安全策略:Shadow deployment(影子部署)——新舊模型同時運行,比較預測結果但只用舊模型的結果做決策。A/B test——隨機分流,一部分使用者用新模型、一部分用舊模型,比較業務指標。Canary release——先對 5% 的流量使用新模型,沒問題再逐步擴大。所有策略都需要事先設定 rollback 機制——如果新模型表現差,一鍵切回舊版本。

  • Data drift(輸入分布變化)不必然導致 concept drift(輸入-輸出關係變化),但都需監控
  • PSI > 0.1 輕微漂移、> 0.25 顯著漂移——需要觸發重訓評估
  • 三層監控:輸入統計量(PSI)、預測品質(precision/recall 趨勢)、系統指標(延遲、錯誤率)
  • 新模型上線用 shadow/A-B/canary 驗證,不要直接切換
  • Rollback 機制必須在部署前設計——出問題時要一鍵回退

一起搭作答骨架

範例 1如何回答「模型評估、公平性與漂移」的比較題?

  1. 定義比較軸與分析單位。
  2. 各寫一條作用機制。
  3. 加入至少兩項條件或風險。
  4. 用案例與指標驗證。

所以作答主軸是:可接受的答案不只一種;關鍵是條件透明、概念正確、推論可追蹤,並能說明限制。

範例 2題目要求提出建議時,如何避免只列 buzzwords?

  1. 先指出要改善的問題。
  2. 說明建議如何改變流程、資訊或激勵。
  3. 指定責任人與衡量方式。
  4. 補上失敗訊號與替代方案。

所以作答主軸是:建議應包含 action、mechanism、metric 與 risk,而不是只寫「導入 AI/雲端/平台」。

這裡最容易寫偏

  • 把工具名稱當成因果解釋
  • 沒有說明分析層級與前提
  • 只寫單一立場,不處理權衡
  • 把非官方參考解析當唯一標準答案
  • 引用時事卻沒有日期與來源邊界

換你快速判斷

先用自己的話說出定義、機制、條件與取捨,再展開答案。

最後用考古題自評

請先完成自己的申論,再依非官方解析和逐項自評標準檢查;不使用 A–E 假選項或虛假分數。

開始本課申論自評

參考來源