AI 倫理、偏差與治理:從公平性指標到法規框架
本頁為依教材與考古題整理的原創摘要;考古題答案經技術覆核,但不是官方答案。
考古題證據邊界: im-it-ai-ethics-governance 目前沒有 direct primary past-paper refs,但 AI 倫理與治理是近年考試趨勢。
第一次接觸也沒關係
這堂先懂這些詞
先記住白話意思,不必急著背英文。看到正文時,再把正式名稱接回來。
生成式 AI 風險治理
也會看到:AI RMF、bias、privacy、accountability、GenAI Profile用明確責任與持續風險流程,管理生成錯誤、偏誤、隱私與使用影響。
- 生活例子:
- 像出版社不因文章流暢就直接刊登,仍要查證、審稿、標示責任並處理更正。
- 別搞混:
- 加上 RAG 或人工抽查能降低部分風險,但都不能保證輸出永遠正確。
大型語言模型與 token
也會看到:LLM、Large Language Model、token、GPT、大型語言模型LLM 從大量 token 序列學習下一個 token 的機率,token 是模型切分文字的基本單位。
- 生活例子:
- 像根據前文玩的超大型接龍,但每一步選的是文字片段而非必然完整單字。
- 別搞混:
- token 不等於一個中文字或一個英文單字;流暢輸出也不保證事實正確。
過度擬合與模型評估
也會看到:overfitting、training set、validation set、test set、precision、recall過度擬合是模型太會記訓練資料卻不會應付新資料,需用未參與訓練的資料與合適指標檢查。
- 生活例子:
- 背熟題庫答案卻遇到改寫題就不會,是過度擬合的生活版。
- 別搞混:
- 訓練分數高不等於模型好;accuracy 也不適合所有不平衡問題。
監督式與非監督式學習
也會看到:supervised learning、unsupervised learning、label、監督式學習、非監督式學習監督式學習從有答案標籤的例子學預測,非監督式學習則從無標籤資料找結構。
- 生活例子:
- 用已標垃圾郵件訓練分類器是監督式;自動把客群分群是非監督式。
- 別搞混:
- 監督式不是有人每一步盯著模型,非監督式也不是完全沒有目標。
從 algorithmic bias 的來源與類型出發,理解 fairness metric 之間的不可能定理,再覆蓋可解釋性(XAI)的技術光譜。最後連結 EU AI Act 與 NIST AI RMF 的風險分級治理框架。補齊零考古題的 AI 倫理子題。
先抓住這幾件事
- 列出 algorithmic bias 在資料收集、標註、模型訓練與部署階段的來源
- 解釋為什麼 demographic parity 和 equalized odds 不能同時滿足
- 區分 inherently interpretable models 與 post-hoc explanation methods
- 比較 EU AI Act 的風險分級與 NIST AI RMF 的自願性框架
先想像這個場景
大學獎學金自動審核系統
大學用 AI 自動初審獎學金申請。有人發現來自偏鄉的申請者通過率明顯較低。調查後發現:訓練資料中偏鄉學生本來就少,而且「推薦信語言豐富度」這個 feature 可能是城鄉差距的 proxy。
先別急著往下看,花十秒想一想:
如果把「居住地」從模型 features 中移除,偏差就會消失嗎?
把故事換成電腦語言
| 生活中的角色 | 對應到 | 技術概念 |
|---|---|---|
| 訓練資料中偏鄉學生少 | Representation bias in training data | |
| 推薦信語言豐富度是城鄉的替代指標 | Proxy variable for protected attribute | |
| 移除居住地後其他 features 仍傳遞同樣資訊 | Removing features doesn't eliminate proxy discrimination | |
| 不同公平指標給出矛盾結論 | Fairness impossibility theorem | |
| 高風險決定需要人工覆核和申訴機制 | Human oversight and accountability in AI governance |
題目出現這些字,先想到
- Bias 可以在資料收集、標註、訓練、部署每個階段產生。
- Demographic parity 和 equalized odds 不能同時滿足(除非 base rate 相同)。
- SHAP/LIME 是 post-hoc explanation,不是因果證明。
- EU AI Act 按風險分級:unacceptable、high-risk、limited、minimal。
1.Bias 不只是模型問題:整個 pipeline 都可能引入
Algorithmic bias 可以在 AI 系統的每個階段產生。資料收集偏差(某些群體在訓練資料中被低代表)、標註偏差(標註者的主觀判斷不一致)、模型偏差(模型放大資料中的 pattern)、部署偏差(模型用在和訓練分布不同的情境)。即使每個環節看起來合理,組合起來仍可能導致系統性不公平。
- 歷史偏差:訓練資料反映過去的不平等,模型學會並延續
- 代表性偏差:某些群體在資料中的比例低於實際人口
- 測量偏差:用 proxy variable 代替真正想衡量的概念
- Feedback loop:模型預測影響未來資料收集,形成自我強化
2.公平性指標:不存在唯一正確的定義
Demographic parity 要求不同群體的 positive rate 相同;equalized odds 要求不同群體的 TPR 和 FPR 相同;calibration 要求相同預測分數在不同群體有相同的實際 positive rate。Impossibility theorem(Chouldechova 2017)證明:除非 base rate 完全相同,不可能同時滿足所有公平性指標。選擇哪個指標是價值判斷,不是純技術問題。
- Demographic parity 不考慮不同群體的 base rate 差異
- Equalized odds 確保模型對不同群體有相同的 error rate
- Impossibility theorem 意味著必須做 trade-off,不能追求全部指標
- 公平性指標的選擇應由 stakeholders 共同決定,不只是工程師
3.可解釋性(XAI):讓黑盒子透明的技術光譜
Inherently interpretable models(linear regression、decision tree)結構本身可解讀。Post-hoc methods 對已訓練好的模型提供解釋:LIME 用局部線性近似、SHAP 基於 game theory 分配每個 feature 的貢獻。但解釋不等於因果,SHAP 值高不代表該 feature 是原因。高風險應用可能需要 inherently interpretable model,而不是在黑盒上加解釋。
- Decision tree 的路徑本身就是解釋
- LIME 在預測點附近建立局部線性模型
- SHAP 為每個 feature 分配一致的邊際貢獻值
- Attention weights 不是可靠的解釋(不等於 feature importance)
4.AI 治理框架:從風險分級到問責
EU AI Act(2024)按風險分級:unacceptable(禁止,如社會信用評分)、high-risk(須合規評估,如招募、信用評分)、limited(透明度義務)、minimal(自由使用)。NIST AI RMF 是自願性框架,用 GOVERN、MAP、MEASURE、MANAGE 四個功能管理 AI 風險。兩者互補:EU AI Act 是法律義務,NIST 是最佳實踐。
- EU AI Act 的 high-risk 類別需要 conformity assessment 和人工監督
- NIST AI RMF 不規定合規標準,而是提供風險管理流程
- Accountability 需要明確指定責任人、audit trail 和 escalation 機制
- AI governance 不只是技術問題:需要法律、倫理和 business 的跨領域合作
一起拆題目
範例 1:一個招聘 AI 的 positive rate(推薦面試)在男性和女性間相同,但女性的 FPR 明顯較高。這是否公平?
- Demographic parity 滿足:positive rate 相同。
- Equalized odds 不滿足:女性 FPR 高,表示更多不適合的女性被推薦。
- 這可能反映 base rate 不同,也可能反映 feature 品質差異。
所以答案是:取決於選擇的公平性定義。這個系統滿足 demographic parity 但違反 equalized odds — 兩者在 base rate 不同時無法同時滿足。
範例 2:某公司用 SHAP 發現「郵遞區號」在信用評分模型中 importance 最高。應該刪掉這個 feature 嗎?
- 郵遞區號可能是 race 或 income 的 proxy variable。
- 但刪掉不一定改善公平性 — 其他 features 可能傳遞同樣的資訊。
- SHAP 顯示相關性,不證明因果或歧視。
- 需要結合 fairness metrics 和 domain expertise 判斷。
所以答案是:SHAP importance 是診斷起點,不是直接的行動指南。需要進一步分析是否構成 proxy discrimination。
這裡最容易選錯
- 認為移除 sensitive attributes 就能消除偏差(proxy variables 仍可傳遞資訊)
- 認為所有公平性指標可以同時滿足(impossibility theorem)
- 把 SHAP/LIME 的 feature importance 當成因果解釋
- 認為 NIST AI RMF 是法律強制要求(它是自願性框架)
- 認為 EU AI Act 只管歐盟公司(任何向歐盟市場提供 AI 的公司都受管轄)
換你快速判斷
先在心中作答,再展開答案。答不出來時,回頭找本課的對照關係。
再到題庫找辨識線索
這個基礎主題在現有考古題中沒有可確認的直接題,所以不會為了湊數量而硬連題目。可回到完整題庫,練習辨識它與相鄰概念的關係。
瀏覽資訊科技概論題庫參考來源
- Artificial Intelligence Risk Management Framework (AI RMF 1.0) — National Institute of Standards and Technology
- EU Artificial Intelligence Act —
- Fair Prediction with Disparate Impact: A Study of Bias in Recidivism Prediction Instruments —