資料生命週期與分析決策:從問題定義到預測應用
題面來自台大官方試卷;解析與逐項自評標準(rubric)為本站依已複查來源整理的非官方內容,策略申論容許有條件且有證據的替代論點。
考古題證據邊界: 考古題只證明此範圍曾出現;題面均為申論或開放題,答案非官方,課程練習採 rubric self-review,絕不進自動計分或完整模擬考。
第一次接觸也沒關係
這堂先懂這些詞
先記住白話意思,不必急著背英文。看到正文時,再把正式名稱接回來。
機器學習使用情境
也會看到:ML use case、AI use case、機器學習明確說明模型要幫誰做哪個決策,以及錯了會造成什麼影響。
- 生活例子:
- 預測明天備多少便當,而不是籠統說導入 AI。
- 別搞混:
- 模型功能不是完整 use case;還要有人、流程與結果。
資料洩漏
也會看到:data leakage、leakage control訓練時偷看到實際部署時不可能取得的答案或未來資訊。
- 生活例子:
- 用是否已退貨去預測下單當下會不會退貨。
- 別搞混:
- 不只是個資外洩;這裡指模型評估被答案或未來資訊污染。
資料漂移/概念漂移
也會看到:data drift、concept drift前者是輸入資料分布改變;後者是輸入與正確答案的關係改變。
- 生活例子:
- 顧客年齡層改變是資料漂移;同樣購物行為不再代表會續訂是概念漂移。
- 別搞混:
- 兩者可分別發生,資料漂移不必然讓模型失效。
深入資料品質治理的實務面向、分析方法的選擇邏輯、以及預測模型如何支持(而非取代)決策。強調「先有問題,再找資料」的正確順序。
先抓住這幾件事
- 設計資料治理流程中的品質檢查點與責任分配
- 區分 descriptive、diagnostic、predictive 與 prescriptive analytics 的適用場景
- 解釋為什麼預測準確不等於決策正確
- 運用社群網路分析的基本指標支持組織決策
1.資料治理從 ownership 開始,不從工具開始
資料治理(data governance)的第一步不是買工具,而是建立角色和責任。三個核心角色:Data owner(資料擁有者,通常是業務部門主管)——對資料品質負最終責任,決定誰可以存取、如何使用、何時刪除。Data steward(資料管理員)——執行治理規則的日常操作,維護 metadata、監控品質指標、處理品質問題。Data consumer(資料使用者)——按規範使用資料,發現問題時回報。 常見的治理失敗模式:只買了 data catalog 工具但沒有指定 owner → metadata 沒人維護 → 半年後 catalog 充滿過時資訊 → 使用者不信任 → 回到用 email 問同事。另一個常見失敗:不同部門對同一個欄位有不同定義(例如行銷部門的「活躍用戶」是 30 天內登入,產品部門的「活躍用戶」是 7 天內有交易行為),沒有 master data management 協調就會產出矛盾的報告。 資料品質五維度(Laudon 教科書版本):Accuracy(資料是否正確反映真實世界?)、Completeness(是否有遺漏?)、Consistency(不同系統中的相同資料是否一致?)、Timeliness(資料是否足夠即時?)、Validity(資料是否符合定義的格式和規則?)。品質問題在 ETL(Extract-Transform-Load)管線中會被放大——上游的一個小錯誤到下游可能影響千萬筆記錄的分析結果。 考試常見:分析某企業的資料治理問題、設計治理流程、解釋為什麼「有資料」不等於「可用的資料」。
- 資料治理三角色:owner(負品質責任)、steward(執行規則)、consumer(按規範使用)
- 只買工具不建角色是最常見的治理失敗——data catalog 沒人維護等於沒有
- Master data management 需要跨部門協商定義——「活躍用戶」在不同部門可能意思不同
- 品質五維度:accuracy、completeness、consistency、timeliness、validity
- ETL 管線會放大品質問題——上游小錯下游可能影響千萬筆分析
2.分析層次決定方法與資源投入
分析不是「都用 AI」——很多問題用 SQL 和視覺化就能回答。分析層次分四級:Descriptive analytics(描述性,回答「發生了什麼?」)用報表和儀表板呈現歷史資料,例如「上月營收是多少?哪個區域成長最快?」。Diagnostic analytics(診斷性,回答「為什麼?」)用 drill-down、交叉分析和關聯分析找到原因,例如「為什麼北區營收下滑?是客戶流失還是客單價降低?」。Predictive analytics(預測性,回答「可能會怎樣?」)用統計模型和機器學習預測未來,例如「下個月的需求量是多少?哪些客戶可能流失?」。Prescriptive analytics(指示性,回答「應該怎麼做?」)用最佳化和模擬找到最佳行動,例如「在預算限制下,如何分配行銷資源最大化 ROI?」 很多企業直接跳到 predictive/prescriptive,但連 descriptive 都沒做好。如果你連「上月各區域營收多少」這個問題都回答不了(因為資料分散在不同系統、定義不一致),就不該急著建機器學習模型。分析成熟度不是線性前進的——應該根據業務問題的需要選擇適合的層級,而不是「越高級越好」。 Predictive analytics 的前提是歷史模式在未來仍然成立(stationarity assumption)。COVID-19 就是一個反例——所有基於歷史消費行為的預測模型在 2020 年初全部失準。所以預測模型需要搭配不確定性估計(prediction interval 而非 point prediction)和異常偵測機制。
- 四層分析:descriptive(報表)→ diagnostic(為什麼)→ predictive(預測)→ prescriptive(最佳化)
- 很多問題用 SQL 和視覺化就夠——不是所有問題都需要 AI
- descriptive 沒做好就不該急著做 predictive——資料品質是前提
- 分析成熟度不是線性前進——按需選擇層級,不是越高越好
- Predictive 的前提是歷史模式未來仍成立——COVID 是 stationarity 被打破的經典反例
3.預測準確不等於決策正確
模型預測的是條件機率(P(Y|X)),不是決策本身。「模型準確」不等於「決策正確」,因為決策還需要考慮:(1) 成本結構——false positive 和 false negative 的代價通常不對稱。在詐騙偵測中,漏掉一筆 100 萬的詐騙(FN)比誤報一筆正常交易(FP)嚴重得多。(2) 倫理限制——即使模型顯示某個群體的違約率較高,是否應該據此拒絕貸款?這涉及公平性和歧視問題。(3) 不可逆性——自駕車的決策錯誤可能致命,金融交易的決策錯誤通常可以補救,兩者需要完全不同的信心門檻。(4) 利害關係人偏好——管理者對風險的態度、法規的要求、社會期待都會影響決策門檻。 所以完整的「從資料到決策」流程是:資料→模型→預測(機率或分數)→ decision boundary(決策閾值,需要人類設定)→行動→結果→回饋。Decision boundary 不是模型決定的,是人類根據成本結構和風險偏好決定的。很多 AI 事故的根因不是模型不準,而是 decision boundary 設錯了或根本沒有人類監督。 考試角度:如果題目給一個 AI 決策出錯的案例,不要只分析模型(「accuracy 不夠高」),要分析整個決策鏈——包括 decision boundary 是否合理、有沒有人類覆核、cost structure 是否被正確考慮。
- 模型預測機率,人類設定 decision boundary——兩者分離是 AI 決策的關鍵設計
- FP 和 FN 的代價通常不對稱——詐騙偵測和垃圾郵件的 boundary 完全不同
- prediction interval(預測區間)比 point prediction 更適合支持決策
- 很多 AI 事故不是模型不準,而是 decision boundary 設錯或缺乏人類監督
- 分析 AI 決策出錯時,要看整個決策鏈,不只看模型 accuracy
4.社群分析用結構指標回答組織問題
社群網路分析(Social Network Analysis, SNA)是一種把關係結構量化的方法,在 MIS 中用於分析組織內的溝通模式、知識流動和影響力分布。SNA 的基礎概念:Node(節點,代表人、部門或組織)和 Edge(邊,代表關係——溝通、合作、資金流動、資訊傳遞)。不同的分析目標需要不同的 centrality 指標: Degree centrality(連結數量)——衡量一個節點有多少直接連結。高 degree 的人「認識很多人」,但不一定是組織中最有影響力的。Betweenness centrality(橋接位置)——衡量一個節點位於多少最短路徑上。高 betweenness 的人是「資訊橋樑」,控制不同群組之間的資訊流動——如果他離職,原本連接的群組可能斷聯。Closeness centrality(到其他人的平均距離)——高 closeness 的人能最快接觸到網路中的所有人,適合需要快速擴散資訊的場景。Eigenvector centrality——不只看你認識多少人,還看你認識的人是否也很有影響力(「認識重要的人」比「認識很多人」更重要)。 使用 SNA 時需要注意:(1) 先定義 node 和 edge 代表什麼——email 往來、專案合作、層級匯報是完全不同的網路。(2) 靜態快照和動態演變的結論可能不同——一年前的溝通網路和現在可能已經不同。(3) centrality 指標的絕對值需要與隨機網路(random graph)比較才有意義——因為即使隨機連結也會產生 centrality 差異。(4) SNA 涉及隱私——記錄誰跟誰溝通的資料本身是敏感的。 考試常見:給一個組織的溝通資料,分析誰是關鍵節點、組織的知識瓶頸在哪裡、如何改善知識流動。
- 四種 centrality:degree(連結多)、betweenness(橋接位置)、closeness(接觸快)、eigenvector(認識重要的人)
- betweenness 高的人是資訊橋樑——離職可能導致群組斷聯
- 先定義 node 和 edge 代表什麼——email、專案合作、匯報是不同的網路
- centrality 的絕對值要跟隨機網路比較才有意義
- SNA 涉及隱私——記錄溝通模式本身是敏感資料
一起搭作答骨架
範例 1:如何回答「資料生命週期與分析決策」的比較題?
- 定義比較軸與分析單位。
- 各寫一條作用機制。
- 加入至少兩項條件或風險。
- 用案例與指標驗證。
所以作答主軸是:可接受的答案不只一種;關鍵是條件透明、概念正確、推論可追蹤,並能說明限制。
範例 2:題目要求提出建議時,如何避免只列 buzzwords?
- 先指出要改善的問題。
- 說明建議如何改變流程、資訊或激勵。
- 指定責任人與衡量方式。
- 補上失敗訊號與替代方案。
所以作答主軸是:建議應包含 action、mechanism、metric 與 risk,而不是只寫「導入 AI/雲端/平台」。
這裡最容易寫偏
- 把工具名稱當成因果解釋
- 沒有說明分析層級與前提
- 只寫單一立場,不處理權衡
- 把非官方參考解析當唯一標準答案
- 引用時事卻沒有日期與來源邊界
換你快速判斷
先用自己的話說出定義、機制、條件與取捨,再展開答案。
最後用考古題自評
請先完成自己的申論,再依非官方解析和逐項自評標準檢查;不使用 A–E 假選項或虛假分數。
開始本課申論自評參考來源
- Management Information Systems: Managing the Digital Firm, 17th Edition — Kenneth C. Laudon; Jane P. Laudon