資料、分析與負責任 AI
題面來自台大官方試卷;解析與逐項自評標準(rubric)為本站依已複查來源整理的非官方內容,策略申論容許有條件且有證據的替代論點。
考古題證據邊界: 考古題只證明此範圍曾出現;題面均為申論或開放題,答案非官方,課程練習採 rubric self-review,絕不進自動計分或完整模擬考。
第一次接觸也沒關係
這堂先懂這些詞
先記住白話意思,不必急著背英文。看到正文時,再把正式名稱接回來。
機器學習使用情境
也會看到:ML use case、AI use case、機器學習明確說明模型要幫誰做哪個決策,以及錯了會造成什麼影響。
- 生活例子:
- 預測明天備多少便當,而不是籠統說導入 AI。
- 別搞混:
- 模型功能不是完整 use case;還要有人、流程與結果。
資料洩漏
也會看到:data leakage、leakage control訓練時偷看到實際部署時不可能取得的答案或未來資訊。
- 生活例子:
- 用是否已退貨去預測下單當下會不會退貨。
- 別搞混:
- 不只是個資外洩;這裡指模型評估被答案或未來資訊污染。
資料漂移/概念漂移
也會看到:data drift、concept drift前者是輸入資料分布改變;後者是輸入與正確答案的關係改變。
- 生活例子:
- 顧客年齡層改變是資料漂移;同樣購物行為不再代表會續訂是概念漂移。
- 別搞混:
- 兩者可分別發生,資料漂移不必然讓模型失效。
AI 可信賴性
也會看到:trustworthiness、trustworthy AIAI 在準確、安全、公平、隱私、透明與可問責等面向值得依賴的程度。
- 生活例子:
- 貸款模型除了準確,還要能申訴、保護資料並監測歧視。
- 別搞混:
- 不等於使用者主觀相信品牌,也不是單一分數。
逐項自評標準
也會看到:rubric、評分規準把好答案拆成一條條可以自行確認的要點,幫你檢查論證是否完整。
- 生活例子:
- 像交報告前用清單確認有定義、理由、例子和限制。
- 別搞混:
- 它不是官方標準答案,也不代表勾選後就取得正式分數。
以 9 題已核對題面為範圍證據,建立「定義→機制→條件與權衡→案例」的申論骨架。所有答案與 rubric 均為非官方自評材料,不提供單一標準論點或自動計分。
先抓住這幾件事
- 描述資料與模型生命週期
- 選擇合適的評估方法
- 分析 AI 專案的治理與維運風險
先想像這個場景
餐廳從備料到持續改菜單
資料像食材,需要驗收、加工、試吃、上線監控,環境改變後還要重新檢查。
先別急著背名詞,花十秒想一想:
如果兩個組織買了同一套技術,結果會必然相同嗎?先列出至少兩個會改變結果的條件,再往下對照。
把故事換成管理語言
| 生活中的角色 | 對應到 | MIS 概念 |
|---|---|---|
| 採買前先確認菜單與顧客需求 | 先定義 ML use case、decision 與 success metric | |
| 食材驗收、清洗與標示來源 | Data quality、label provenance 與 governance | |
| 試菜分成調整配方與最後驗收 | Validation/test separation 與 leakage control | |
| 開店後監看退餐、客群與季節變化 | Production monitoring、data/concept drift 與 retraining |
題目出現這些字,先想到
- 先界定題目名詞與分析單位。
- 再寫出因果機制,不只列工具名稱。
- 補上適用條件、風險與替代方案。
- 最後用題目案例驗證,並指出比喻或主張的限制。
1.資料生命週期從決策問題開始
AI 專案最常見的失敗模式不是模型不好,而是從一開始就沒有搞清楚要解決什麼決策問題。Google 的 ML Rules(Rule #1)明確指出:「Don't be afraid to launch a product without machine learning.」——先確認 ML 真的能比簡單規則做得更好,再投資。 資料生命週期的正確順序是:(1) 定義決策問題——模型的輸出會支持誰做什麼決策?錯誤的成本是什麼?(2) 確認資料可行性——需要什麼資料?這些資料是否可取得、合法、品質夠好?(3) 建立 baseline——用最簡單的方法(規則、統計模型)先建立一個基準,確認問題值得用 ML 解決。(4) 收集與清理資料——記錄資料來源(provenance)、標注方法、品質問題和 consent 狀態。(5) 特徵工程與模型訓練。(6) 評估與部署。(7) 監控與維護。 很多 MIS 教材只講後面幾步(模型怎麼建),但考試更常考前面幾步:什麼問題適合用 AI 解決?什麼時候不應該用 AI?資料品質不好時怎麼辦?這些管理決策的考題用技術知識答不了。 考試常見題型:給一個 AI 應用場景,問你如何評估它是否可行。好的答案從決策問題開始,不從演算法開始。
- AI 專案從決策問題開始,不從資料或演算法開始(Google ML Rule #1)
- 先用簡單 baseline 確認問題值得用 ML,避免 over-engineering
- 資料品質五維度:accuracy、completeness、consistency、timeliness、validity
- 記錄資料來源(provenance)和 consent 是治理的基礎,不是事後補做
- 很多 AI 專案的失敗原因不是模型差,而是決策問題沒定義清楚或資料不可行
2.評估指標要符合任務與風險
模型評估是 MIS 考試的高頻考點,但很多考生只知道 accuracy 一個指標。實際上不同的任務需要不同的指標,而且「模型準確」不等於「決策正確」。 分類任務的核心指標:Accuracy(整體正確率)在不平衡資料中幾乎無用——如果 99% 的交易是正常的,一個「全部猜正常」的模型 accuracy 就是 99%,但它完全無法偵測詐騙。Precision(查準率)=「模型說是詐騙的裡面,真的是詐騙的有多少」,Recall(查全率)=「所有真正的詐騙裡面,模型找到了多少」。兩者之間有 trade-off:調高 threshold 會提高 precision 但降低 recall。選擇哪個指標更重要取決於業務脈絡:詐騙偵測優先 recall(寧可多查也不能漏掉),垃圾郵件過濾優先 precision(寧可放過也不能誤殺重要信件)。 迴歸任務的指標:MSE(均方誤差)、MAE(平均絕對誤差)、R²(解釋變異比例)。排序任務的指標:AUC-ROC、NDCG。 但離線指標(offline metrics)永遠只是估計。真正重要的是線上指標(online metrics)——模型上線後,業務指標(轉化率、退貨率、客訴量)是否真的改善了?很多時候離線 accuracy 高但線上效果差,原因包括:training-serving skew(訓練和部署的資料分布不同)、feedback loop(模型決策改變了使用者行為)、A/B test 的 novelty effect(新鮮感消退後效果下降)。 考試提醒:回答時要說清楚你選什麼指標、為什麼選這個、在什麼條件下這個指標可能誤導。
- Accuracy 在不平衡資料中幾乎無用——99% 正常的資料中全猜正常也有 99% accuracy
- Precision vs Recall 的取捨取決於業務:漏檢成本高選 recall,誤報成本高選 precision
- 離線指標只是估計,線上業務指標(轉化率、客訴量)才是最終判斷
- Training-serving skew 和 feedback loop 是離線好但線上差的常見原因
- 沒有 ground truth 的任務(例如推薦系統)需要用 proxy metric,但要揭露 proxy 的限制
3.部署後模型仍是持續運作的系統
AI 模型不像傳統軟體——程式碼部署後行為是確定的。AI 模型部署後,如果輸入資料的分布改變了(data drift),模型的預測品質就會下降。更嚴重的是 concept drift:即使輸入分布不變,輸入和輸出之間的關係也可能改變(例如 COVID-19 改變了消費行為模式,導致原本準確的需求預測模型完全失準)。 監控(monitoring)是 AI 維運的核心。需要同時監控:(1) 輸入統計量——特徵的分布是否偏離訓練時的分布?可以用 PSI(Population Stability Index)或 KS-test 量化。(2) 預測品質——如果有 ground truth(例如事後知道是否真的是詐騙),追蹤 precision/recall 的變化趨勢。如果沒有 ground truth(例如推薦系統的長期效果),用 proxy metric 和人工抽樣。(3) 系統指標——延遲(latency)、吞吐量(throughput)、錯誤率、資源使用率。 當監控發現問題時,應對策略包括:定期重訓(scheduled retraining)、觸發式重訓(drift 超過閾值時觸發)、持續學習(online learning,但風險更高)。新模型上線前必須經過 shadow deployment(影子部署,新模型與舊模型同時運行,比較結果)或 A/B test。設定 rollback 機制——如果新模型表現差,立即切回舊版本。 考試角度:台大 MIS 考 AI 時很少考演算法細節,更常考「一個 AI 系統上線後會出什麼問題、怎麼處理」。
- Data drift(輸入分布變化)不必然導致 concept drift(輸入-輸出關係變化),但都需要監控
- 監控三個層面:輸入統計量(PSI、KS-test)、預測品質(precision/recall 趨勢)、系統指標(延遲、錯誤率)
- 新模型上線用 shadow deployment 或 A/B test 驗證,不要直接切換
- Rollback 機制必須在部署前設計好——出問題時要能一鍵回退
- 模型版本控制(model registry)記錄每個版本的超參數、訓練資料和評估結果
醫院用 AI 篩檢癌症,漏診(FN)代價極高。應優先什麼指標?
4.AI 治理連結責任與控制
AI 治理(AI governance)是近年台大 MIS 考試的熱門議題。很多企業導入 AI 的動機是 FOMO(fear of missing out,怕落後),而不是清晰的業務需求。結果是:大量 POC(概念驗證)但很少進入生產;進入生產的也缺乏監控和問責。Gartner 曾估計超過 85% 的 AI 專案無法產出商業價值。 NIST AI Risk Management Framework(AI RMF)提供了一個結構化的治理框架,分為四個功能:(1) Map——辨識 AI 系統的脈絡:誰是利害關係人?可能的失敗模式是什麼?影響範圍和嚴重程度?(2) Measure——選擇 trustworthiness 特性(accuracy、fairness、transparency、explainability、security、privacy、robustness)的量化指標。(3) Manage——設計風險降低措施:監控、人工覆核(human-in-the-loop)、escalation 流程、incident response。(4) Govern——建立組織層面的治理結構:角色與責任(誰對 AI 決策負責?)、政策(什麼場景禁止使用 AI?)、accountability 機制(出問題時如何追責?)。 AI RMF 不是法規(非強制),但可以作為答題的結構化框架。考題問「如何設計一個負責任的 AI 系統」時,用 Map-Measure-Manage-Govern 四步回答,比列出「要公平、透明、可解釋」這種空洞清單要好得多。 另一個常考的概念是 AI 的 liability(責任歸屬):當 AI 做出錯誤決策(例如自駕車撞人、信貸模型歧視),責任在開發者、使用者、還是 AI 供應商?目前沒有統一答案,但 EU AI Act 的風險分級方法(unacceptable/high/limited/minimal risk)是重要的參考框架。
- FOMO 是很多企業導入 AI 的真正動機,結果是大量 POC 但很少進入生產
- NIST AI RMF 四步:Map(辨識脈絡)→ Measure(量化指標)→ Manage(降低風險)→ Govern(治理結構)
- AI 的 liability 目前沒有統一答案——開發者、使用者、供應商的責任邊界模糊
- EU AI Act 按風險分級:不可接受/高風險/有限風險/最低風險,不同級別有不同要求
- 答題用 Map-Measure-Manage-Govern 框架,比列「公平透明可解釋」等空洞清單好得多
一起搭作答骨架
範例 1:如何回答「資料、分析與負責任 AI」的比較題?
- 定義比較軸與分析單位。
- 各寫一條作用機制。
- 加入至少兩項條件或風險。
- 用案例與指標驗證。
所以作答主軸是:可接受的答案不只一種;關鍵是條件透明、概念正確、推論可追蹤,並能說明限制。
範例 2:題目要求提出建議時,如何避免只列 buzzwords?
- 先指出要改善的問題。
- 說明建議如何改變流程、資訊或激勵。
- 指定責任人與衡量方式。
- 補上失敗訊號與替代方案。
所以作答主軸是:建議應包含 action、mechanism、metric 與 risk,而不是只寫「導入 AI/雲端/平台」。
這裡最容易寫偏
- 把工具名稱當成因果解釋
- 沒有說明分析層級與前提
- 只寫單一立場,不處理權衡
- 把非官方參考解析當唯一標準答案
- 引用時事卻沒有日期與來源邊界
換你快速判斷
先用自己的話說出定義、機制、條件與取捨,再展開答案。
1資料生命週期與分析可行性:答題時先定義什麼?
先界定 資料生命週期與分析可行性 的分析單位、核心機制與適用條件。
MIS 概念不能只背名詞;定義後必須說明它如何改變資訊、協調、成本、能力或風險。
2資料生命週期與分析可行性:完整申論至少要補哪三類內容?
機制、條件/權衡、可觀察指標與限制。
以「主張→因果機制→成立條件→案例/指標→限制」自我檢查,合理替代論點亦可接受。
3模型評估、公平與漂移:答題時先定義什麼?
先界定 模型評估、公平與漂移 的分析單位、核心機制與適用條件。
MIS 概念不能只背名詞;定義後必須說明它如何改變資訊、協調、成本、能力或風險。
4模型評估、公平與漂移:完整申論至少要補哪三類內容?
機制、條件/權衡、可觀察指標與限制。
以「主張→因果機制→成立條件→案例/指標→限制」自我檢查,合理替代論點亦可接受。
5預測、社群分析與決策:答題時先定義什麼?
先界定 預測、社群分析與決策 的分析單位、核心機制與適用條件。
MIS 概念不能只背名詞;定義後必須說明它如何改變資訊、協調、成本、能力或風險。
6預測、社群分析與決策:完整申論至少要補哪三類內容?
機制、條件/權衡、可觀察指標與限制。
以「主張→因果機制→成立條件→案例/指標→限制」自我檢查,合理替代論點亦可接受。
7AI 維運、導入與治理:答題時先定義什麼?
先界定 AI 維運、導入與治理 的分析單位、核心機制與適用條件。
MIS 概念不能只背名詞;定義後必須說明它如何改變資訊、協調、成本、能力或風險。
8AI 維運、導入與治理:完整申論至少要補哪三類內容?
機制、條件/權衡、可觀察指標與限制。
以「主張→因果機制→成立條件→案例/指標→限制」自我檢查,合理替代論點亦可接受。
最後用考古題自評
請先完成自己的申論,再依非官方解析和逐項自評標準檢查;不使用 A–E 假選項或虛假分數。
開始本課申論自評參考來源
- Management Information Systems: Managing the Digital Firm, 17th Edition — Kenneth C. Laudon; Jane P. Laudon
- Artificial Intelligence Risk Management Framework 1.0 — NIST
- NIST Privacy Framework — NIST
- Rules of Machine Learning: Best Practices for ML Engineering — Martin Zinkevich