內容已複查
34 分鐘 · 6 張概念卡 · 6 題對應考古題

新興科技與數位應用:從服務分類到感知與數位分身

本頁為依教材與考古題整理的原創摘要;考古題答案經技術覆核,但不是官方答案。

第一次接觸也沒關係

這堂先懂這些詞

先記住白話意思,不必急著背英文。看到正文時,再把正式名稱接回來。

Fintech 與數位服務

也會看到:Fintech、mobile payment、crowdfunding、MOOC

Fintech 是用科技改善金融服務;行動支付、群眾募資與線上開放課程則各有不同目的。

生活例子:
手機付款是支付工具,群眾募資是向多人募集資金,MOOC 是大規模線上課程。
別搞混:
這些名詞不能因為都在網路上運作就視為同一類服務。

數位分身

也會看到:digital twin

用持續更新的資料,讓電子模型反映某個實體設備或流程的目前狀態。

生活例子:
工廠把機器溫度與震動同步到虛擬模型,先模擬何時需要維修。
別搞混:
它不是一張靜態 3D 圖;關鍵是和實體狀態有資料連結。

環境感知與定位

也會看到:perception、localization、autonomous driving、sensor fusion

感知辨認周遭物體與狀況;定位判斷自己在地圖或環境中的位置。

生活例子:
像騎車時先看見前方行人,再確認自己位於哪條車道。
別搞混:
看見物體、知道自己在哪裡與決定下一步,是不同功能。

語音互動流程

也會看到:voice-only smart speaker、speech recognition、intent、speech synthesis

裝置先收音與辨識語句,再判斷意圖、執行服務,最後用合成語音回答。

生活例子:
像對語音助理說『設七點鬧鐘』,它聽懂、建立鬧鐘後再口頭確認。
別搞混:
只靠語音的裝置沒有螢幕視覺輸出;能辨識語音也不等於理解所有語意。

以應用要解決的問題區分 Fintech、crowdfunding、MOOC 與 mobile payment,再拆解原始 voice-only smart speaker、自動駕駛與 digital twin 的輸入、處理與輸出。對應考古題答案均為非官方技術覆核;產品能力以題目所述年代與裝置範圍為準。

先抓住這幾件事

  • 依服務目的區分 Fintech、mobile payment、crowdfunding 與 MOOC。
  • 以輸入、處理、輸出描述 voice-only smart speaker 的語音互動流程。
  • 區分自動駕駛中的環境感知、定位與決策功能。
  • 說明 digital twin 如何以實體狀態更新電子表示並支援監控、模擬與維護。

先想像這個場景

逛一圈智慧城市體驗館

你走進一座智慧城市體驗館:入口用手機付款,創作者攤位邀請群眾資助新產品,學習區開放線上課程,語音導覽柱只靠麥克風與喇叭互動,戶外接駁車融合多種感測資訊,中央控制室則用會隨實體設備更新的模型監看整座館。看似都叫新科技,分類時仍要先看每一站解決的問題與資料流。

先別急著往下看,花十秒想一想:

接駁車同時收到 camera、radar、lidar 與 GPS 資料;若題目問『哪一項主要提供全域定位,而不是直接觀察附近物體』,你會選哪一項?

把故事換成電腦語言

生活中的角色對應到技術概念
入口用手機完成付款;創作者則向許多支持者募集專案資金Mobile payment 是 Fintech 的支付應用;由群眾共同資助專案是 crowdfunding,應依服務目的區分
學習區讓大量學習者透過網路參與開放式課程MOOC 是 Massive Open Online Course;edX、Coursera、Udacity 是常見平台例子,不是 MOOC 定義本身
Voice-only 導覽柱聽見問題、理解意圖,再用聲音回答Microphone input → speech recognition → NLP/intent → action → speech synthesis;沒有影像輸入時 image recognition 不是必要步驟
接駁車用 camera、radar、lidar 觀察附近物體,用 GPS 協助判斷所在位置Perception 與 localization 是不同功能;GPS 主要提供定位資訊,不等於直接感知障礙物
控制室的電子館舍會接收實體設備狀態,並用來監控與模擬Digital twin 以會更新的 electronic representation 連結 real-world entity;不更新的 3D model 不必然是 twin

題目出現這些字,先想到

  • 看到付款、募資或線上課程:先問服務目的;付款是 mobile payment,群眾資助專案是 crowdfunding,MOOC 是 massive open online course。
  • 看到原始 voice-only smart speaker:沿 microphone、speech recognition、NLP、speech synthesis 檢查,別把後來的 camera 功能倒推回去。
  • 看到 autonomous car 感知題:camera/radar/lidar 對應周遭觀測,GPS 主要對應 localization。
  • 看到 monitoring、simulation、real-world counterpart:先想到 digital twin,並檢查是否有實體狀態連結與更新。

1.先辨識服務目的,再辨識使用的技術

考古題中的「新興科技」題目通常不是考深層技術原理,而是考你能否正確辨識:(1) 某項服務或產品解決什麼問題。(2) 它使用了哪些技術組合。(3) 這些技術分別扮演什麼角色。 【雲端服務模型】 • IaaS(Infrastructure as a Service)— 提供虛擬化的運算、儲存、網路資源。使用者管理 OS 以上的所有層級。例如 AWS EC2、Azure VM。 • PaaS(Platform as a Service)— 提供開發和部署應用程式的平台。使用者只管理應用程式和資料。例如 Google App Engine、Heroku。 • SaaS(Software as a Service)— 提供現成的應用程式,使用者只使用軟體。例如 Gmail、Salesforce、Microsoft 365。 記憶法:從 IaaS 到 SaaS,供應商管理的範圍越來越大,使用者的控制權越來越小。 【IoT(Internet of Things)】把實體裝置(感測器、家電、車輛、工廠設備)連上網路,收集資料並遠端控制。IoT 的典型架構:感測器 → 邊緣裝置(local processing)→ 雲端(分析和儲存)→ 應用(dashboard、自動控制)。 【Fintech 常見應用】 • 行動支付(如 Apple Pay、Line Pay)— NFC 或 QR code。 • P2P 轉帳 — 不經過傳統銀行的直接轉帳。 • Robo-advisor — 用演算法提供投資建議。 • Blockchain 應用 — 加密貨幣、DeFi。 【考試連結】題目常給一個服務描述,問它屬於 IaaS/PaaS/SaaS,或問「以下哪項技術被用在此服務中」。關鍵是先辨識服務的目的(問題是什麼),再辨識技術(用什麼解決)。不要被品牌名稱誤導 — Azure 同時提供 IaaS、PaaS、SaaS,不能只說「Azure 是 IaaS」。

  • Fintech 的範圍可包含支付、借貸、保險、投資與監理科技,不只 mobile payment。
  • Mobile payment 的核心是啟動、授權或完成付款,不是所有募集資金網站都屬於支付服務。
  • Crowdfunding 的核心是由群眾對專案提供資金;Kickstarter 是典型平台。
  • MOOC 是 Massive Open Online Course;Udacity、Coursera 與 edX 常作為此類線上學習平台的例子。

2.Voice-only smart speaker 的語音處理鏈

Smart speaker(智慧音箱,如 Amazon Echo、Google Home)是一個整合多項 AI 技術的產品。考古題常考你能否辨識它使用了哪些技術以及各自的角色。 【語音處理完整流程】 (1) Wake word detection(喚醒詞偵測)— 裝置在本地(on-device)持續監聽「Alexa」「Hey Google」等喚醒詞。這一步通常用小型 keyword spotting 模型在裝置上運行,不需要上傳到雲端。 (2) Automatic Speech Recognition (ASR) — 把使用者的語音轉換成文字。例如「明天台北天氣如何」→ 文字序列。現代 ASR 使用深度學習模型(如 end-to-end transformer models)。 (3) Natural Language Understanding (NLU) — 理解文字的意圖和關鍵資訊。「明天台北天氣如何」→ intent: 查詢天氣, entity: location=台北, time=明天。NLU 結合了 intent classification 和 named entity recognition (NER)。 (4) Dialog Management — 管理對話狀態和流程。決定下一步是回答問題、追問更多資訊、還是執行動作。 (5) Response Generation + Text-to-Speech (TTS) — 產生回覆文字,再用 TTS 合成語音。TTS 把文字轉換成自然流暢的語音(speech synthesis),現代系統如 WaveNet 能產生接近真人的語音。 【考試連結】(1) 考古題 107-1 考 smart speaker 使用的 AI 技術。(2) ASR(語音→文字)和 TTS(文字→語音)是反方向的。(3) NLP 是 Natural Language Processing 的總稱,包含 NLU 和 NLG。(4) 不要把 speech recognition(語音辨識)和 speaker recognition(說話者辨識)搞混 — 前者辨識「說了什麼」,後者辨識「誰在說」。

  • Speech recognition 處理聲音到詞語或文字的轉換。
  • Natural language processing 用於理解使用者意圖與參數。
  • Speech synthesis 把系統回覆轉成可播放語音。
  • 後來帶螢幕或 camera 的產品可能使用影像技術,不能把歷史題目的 voice-only 限定外推到所有新型裝置。

3.自動駕駛要分開看感知、定位與決策

自動駕駛(autonomous driving)涉及三大技術模組,考古題常考你能否正確辨識每個模組使用的技術: 【Perception(感知)】— 偵測周圍環境中的物件 • Camera(攝影機)— 拍攝影像,用 computer vision(特別是 CNN)偵測車輛、行人、交通號誌、車道線。 • LiDAR(Light Detection and Ranging)— 發射雷射光束,測量反射時間得到精確的 3D 點雲(point cloud)。能精確測量距離和物體形狀,但成本高、受天氣影響。 • Radar — 發射無線電波,偵測物體距離和速度。穿透力強(雨霧中仍可用),但解析度較低。 • Ultrasonic sensor — 超短距離偵測(如停車時偵測障礙物)。 多種感測器融合(sensor fusion)提供更可靠的環境感知。 【Localization(定位)】— 確定車輛在地圖上的精確位置 • GPS/GNSS — 全球定位,精度約 1-5 公尺。不夠精確用於車道級定位。 • HD Map(高精地圖)— 預先建置的詳細道路模型,包含車道線、交通號誌位置等。 • SLAM(Simultaneous Localization and Mapping)— 同時建圖和定位。 • GPS + IMU + 視覺里程計的融合 — 提供公分級定位。 【Decision(決策)】— 規劃路徑和控制車輛 • Path planning — 規劃從 A 到 B 的最佳路線。 • Motion planning — 決定下一秒的速度、方向、加速度。 • Control — 把決策轉換成方向盤角度、油門/煞車力道。 【SAE 自動駕駛等級】L0(無自動化)→ L1(單項輔助)→ L2(部分自動化,如 Tesla Autopilot)→ L3(有條件自動化)→ L4(高度自動化,限定區域)→ L5(完全自動化)。 【考試連結】(1) Camera + computer vision 是 perception 的核心技術,不是 navigation 技術。(2) LiDAR 提供 3D 距離資訊,Camera 提供 2D 影像 — 兩者互補。(3) 考古題 108-8 考自動駕駛的感測技術。

  • Perception 將 sensor observations 轉成物體、車道或可通行空間等估計。
  • Localization 估計車輛在地圖或座標系中的位置,通常融合多種訊號。
  • Planning 根據目標、道路與障礙物選擇路徑或動作。
  • Control 把規劃結果轉成轉向、煞車與加速命令;任一感測來源都不應被當成整套自動駕駛。

4.Digital twin 是會隨實體狀態更新的電子表示

Digital twin(數位分身/數位孿生)是一個實體物件、流程或系統的虛擬副本,透過即時資料流和實體保持同步。它不是靜態的 3D 模型或 CAD 圖 — 關鍵特徵是「持續同步更新」。 【運作機制】 (1) Physical entity(實體):裝配 IoT 感測器,持續收集溫度、壓力、震動、位置等資料。 (2) Data transmission:感測器資料透過網路傳送到雲端。 (3) Digital twin(虛擬):根據即時資料更新虛擬模型的狀態。可以包含物理模擬(physics simulation)來預測行為。 (4) Feedback loop:在虛擬環境中測試不同的「what-if」情境,根據結果對實體進行調整。 【應用場景】 • 製造業 — 工廠設備的 digital twin 監控運行狀態,預測何時需要維護(predictive maintenance),減少意外停機。 • 城市規劃 — 建築物的 digital twin 模擬能源消耗、人流動線、災害影響。 • 醫療 — 人體器官的 digital twin 模擬藥物反應或手術效果。 • 航太 — NASA 的 Apollo 13 任務就是早期的 digital twin 概念 — 在地面的模擬器中重現太空中的故障情境,找出解決方案。 【Digital Twin vs Simulation vs 3D Model】 • 3D Model:靜態的視覺表示。 • Simulation:可以模擬行為,但通常不和實體即時同步。 • Digital Twin:和實體即時同步 + 可以模擬 + 可以反向控制。三者是遞進關係。 【考試連結】(1) Digital twin 的核心特徵是「和實體即時同步」。(2) 不要把 digital twin 和一般的資料庫或監控面板混淆 — digital twin 包含行為模型和模擬能力。(3) IoT 是 digital twin 的基礎設施 — 沒有感測器資料就沒有即時同步。

  • Physical entity 是被表示的設備、流程或系統。
  • Sensors/records 把實體狀態送入資料流程,更新 electronic representation。
  • Simulation 可比較不同操作條件,monitoring 可追蹤目前狀態。
  • Digital model 若沒有與實體狀態連結或更新,不一定符合課程所用的 digital twin 定義。

一起拆題目

範例 1將下列服務分類:①以手機完成商店付款;②由 2,000 名支持者共同資助一項桌遊專案;③向大量網路學習者開放的大學課程;④用演算法改善貸款風險評估。

  1. ① 的核心是完成付款,屬 mobile payment,也可位於廣義 Fintech 範圍。
  2. ② 的資金來自許多專案支持者,屬 crowdfunding。
  3. ③ 是大規模、開放、線上課程,屬 MOOC。
  4. ④ 把數位技術應用於金融服務,屬 Fintech,但不是 mobile payment。

所以答案是:① mobile payment(亦屬廣義 Fintech);② crowdfunding;③ MOOC;④ Fintech。

範例 2某原始 voice-only smart speaker 只有 microphone 與 speaker。使用者說『把客廳燈打開』後,系統需辨識語音、理解意圖、控制燈具並語音回覆。speech recognition、NLP、speech synthesis、image recognition 中,哪一項不是完成此流程的必要技術?

  1. Microphone 收到的語音需由 speech recognition 轉成可處理內容。
  2. NLP 判斷『打開』動作與『客廳燈』目標。
  3. 系統執行裝置控制,speech synthesis 可產生語音回覆。
  4. 題面沒有 camera 或影像輸入,image recognition 不在這條 voice-only 流程中。

所以答案是:Image recognition。此結論只針對題面限定的原始 voice-only 裝置,不外推到帶 camera 的產品。

範例 3自動駕駛車收到四項資料:camera frame、radar range、lidar point cloud、GPS coordinates。若問題是『哪一項主要提供全域定位,而非直接觀察附近物體』,應選哪一項?

  1. Camera frame 可由 computer vision 辨識車道、車輛或行人。
  2. Radar range 與 lidar point cloud 可提供周遭物體距離或幾何觀測。
  3. GPS coordinates 描述車輛位置,屬 localization input。
  4. 因此在題面四項中,GPS 最符合『定位而非直接環境感知』。

所以答案是:GPS coordinates;它提供定位資訊,周遭物體仍需其他 sensors/perception 方法觀察。

範例 4工廠每分鐘把馬達溫度送到電子模型,模型顯示目前狀態,並模擬若轉速提高 10% 時的溫度。這是否符合 digital twin?若只有一張從不更新的 3D 圖呢?

  1. 電子模型代表一個真實馬達。
  2. 感測資料持續更新模型狀態,建立實體與電子表示的連結。
  3. 模型同時支援 monitoring 與 what-if simulation,因此符合本課 digital twin 特徵。
  4. 不更新的 3D 圖缺少狀態同步,只能稱為靜態 digital model,不能僅憑外觀認定為 twin。

所以答案是:持續接收實體狀態並支援監控/模擬者符合 digital twin;從不更新的 3D 圖不符合本課定義。

這裡最容易選錯

  • 把 Fintech 縮小成只有 mobile payment,或把所有手機服務都稱為 Fintech。
  • 把 crowdfunding 平台誤當成一般 mobile payment provider。
  • 看到 smart speaker 就一律說需要 image recognition,忽略題面的 voice-only 與年代限定。
  • 把 GPS 當成能直接偵測附近障礙物形狀的環境感測器。
  • 把任何 3D model 都稱為 digital twin,忽略實體狀態連結與更新。
  • 把產品例子當成永遠不變的定義;品牌功能會隨版本與年代改變。

換你快速判斷

先在心中作答,再展開答案。答不出來時,回頭找本課的對照關係。

1Fintech、mobile payment 與 crowdfunding 如何區分?

Fintech 是數位技術應用於金融服務的廣義類別;mobile payment 聚焦付款;crowdfunding 由群眾共同資助專案。

Mobile payment 可是 Fintech 子類,但 crowdfunding 平台的主要服務目的不是替商店完成付款。

2MOOC 的全名與核心形式是什麼?

Massive Open Online Course;以網路向大量學習者提供開放式課程。

Udacity、Coursera 與 edX 常作為 MOOC 平台例子;平台也可能同時提供不完全開放或付費的其他課程形式。

3原始 voice-only smart speaker 的基本處理鏈是什麼?

Microphone input → speech recognition → NLP/intent → service 或 device action → speech synthesis/output。

若題面限定只有 microphone 與 speaker,image recognition 不是這條語音流程的必要技術;不能外推到後來帶 camera 的產品。

4自動駕駛中 GPS 與 lidar/radar/camera 的角色差異為何?

GPS 主要提供定位;lidar、radar、camera 則提供周遭環境觀測,供 perception 使用。

完整系統會融合來源;『GPS 不直接感知附近物體』不等於 GPS 對自動駕駛不重要。

5Digital twin 與不更新的 3D model 有何差異?

Digital twin 以電子表示連結實體,能觀察實體狀態及狀態轉換;靜態 3D model 不一定有此同步關係。

Digital twin 可支援 monitoring、simulation、testing 與 maintenance,但準確度仍受資料與模型限制。

6判斷新興數位應用時,為何要先問『服務目的』?

相同底層技術可支援不同服務;先辨認付款、募資、學習、感知或模擬等目的,才能正確分類。

網站、手機、AI 都只是可能的 delivery/enabling technology,不能單獨決定應用類別。

最後用考古題驗證

本課連結的題目都已通過可重現的技術覆核,可逐題練習與判分。

開始本課考古題練習

參考來源