所屬科目:iPAS◆AI應用規劃師◆初級
1.資料基本概念與來源某製造業導入AI排程系統,需同時使用ERP訂單資料、設備感測器每秒回傳的溫度與震動數值,以及維修人員以文字描述的異常紀錄。若資料治理人員需判斷資料型態,下列哪一項最為正確?(A)ERP訂單資料屬非結構化資料,感測器資料屬半結構化資料,維修文字屬結構化資料(B)ERP訂單資料與感測器數值通常屬結構化資料,維修文字描述通常屬非結構化資料(C)三者皆屬結構化資料,因為都可儲存在企業系統中(D)三者皆屬非結構化資料,因為都需要AI模型才能分析
2.某電商公司希望建立顧客流失預測模型,可取得會員基本資料、網站瀏覽紀錄、客服對話紀錄與外部景氣指標。若專案經理要先區分資料來源,下列哪一項判斷最合理?(A)會員資料與瀏覽紀錄屬內部資料,外部景氣指標屬外部資料(B)客服對話紀錄因為是文字資料,所以一定屬外部資料(C)只要資料用於AI訓練,就不需要區分內部或外部來源(D)外部景氣指標因為可下載成表格,所以屬內部資料
3.某銀行建立信用風險模型,資料表包含「年收入」、「逾期次數」、「職業類別」、「信用等級A/B/C」等欄位。若資料科學家需判斷變數型態,下列敘述何者最正確?(A)年收入與逾期次數皆屬數值型資料,職業類別屬類別型資料,信用等級屬有序類別資料(B)所有欄位都屬數值型資料,因為模型最終都會轉成數字處理(C)職業類別屬連續數值資料,因為可用編碼方式轉換(D)信用等級沒有順序意義,只能視為一般文字資料
4.某智慧農業專案每5秒蒐集土壤濕度、溫度、光照與灌溉狀態,並希望即時偵測異常灌溉。就資料特性而言,該專案最需要優先注意下列哪一項?(A)資料完全不會產生時間順序,因此不需保存時間戳記(B)資料具有連續產生與時間序列特性,需保存時間戳記並處理資料流(C)資料來源單純,因此不需要檢查感測器校正與缺漏(D)資料只要平均後保存,便能滿足所有即時偵測需求
5.某企業整合多個部門資料時,發現「客戶代號」在CRM、ERP與客服系統中的命名規則不同,導致同一客戶可能被視為多筆資料。為降低後續分析錯誤,最應優先建立哪一類基礎文件或規範?(A)資料字典與欄位定義規範(B)行銷活動文案範本(C)模型訓練GPU使用規範(D)客服人員排班表
6.某醫療研究團隊蒐集病患問卷資料作為AI風險評估模型來源,但問卷主要來自單一都會區大型醫院,較少包含偏鄉與高齡族群樣本。若直接使用該資料訓練模型,最可能產生哪一項問題?(A)樣本代表性不足,模型可能對未充分涵蓋族群表現較差(B)資料筆數太多,導致模型無法進行任何訓練(C)問卷資料屬結構化資料,因此一定不會有偏差(D)只要模型準確率高,就不需要檢查資料來源分布
7.某零售集團準備向第三方資料商購買消費者偏好資料,並與自家會員交易資料合併分析。資料長提供欄位清單與範例資料,但未說明資料蒐集方式、更新頻率與授權範圍。若以資料可用性與合規風險評估,下列何者最適當?(A)只要資料欄位多,就可直接納入模型訓練(B)應先確認資料來源、蒐集目的、授權條件、更新頻率與品質,再決定是否使用(C)第三方資料必然比企業內部資料準確,因此可優先使用(D)資料可被轉成表格,即表示不存在授權或隱私問題
8.某公司第一次建立AI銷售預測專案,團隊想依序完成問題定義、資料理解、資料準備、模型建立、評估與部署。此流程最接近下列哪一種資料分析專案方法?(A)CRISP-DM資料探勘流程(B)單純系統備份流程(C)固定資產盤點流程(D)網頁版型設計流程
9.某人資部門整理員工滿意度問卷時,發現部分問卷缺少「年資」欄位。若分析人員要處理缺失值,下列哪一項做法最符合資料整理原則?(A)不檢查缺失比例與原因,直接把所有缺失值改成0(B)先分析缺失比例與可能原因,再依欄位意義選擇刪除、補值或另設未知類別(C)只要有缺失值,就必須刪除整份資料表(D)缺失值一定代表受訪者惡意填答,應全部排除
10.某資料科學團隊在建立房價預測模型前,先用完整資料集計算平均值與標準差,再將資料切分為訓練集與測試集。上線後發現模型評估結果過度樂觀。下列何者最能說明問題所在?(A)在資料切分前使用完整資料計算標準化統計量,可能造成資料洩漏(B)標準化一定會降低模型準確率,因此不應使用(C)測試資料應參與模型訓練,才能提升泛化能力(D)只要資料量夠大,資料切分順序不會影響評估
11.某電商平台的顧客資料表中,「地區」欄位包含台北、新北、桃園等類別。若團隊要將此欄位提供給一般機器學習模型使用,且不希望模型誤以為地區之間有大小順序,最適合的處理方式為何?(A)Label Encoding,將台北設為1、新北設為2、桃園設為3(B)One-hot Encoding,將各地區轉為獨立二元欄位(C)直接刪除地區欄位,避免任何分析(D)將所有地區合併為同一類別,以降低資料量
12.某保險公司分析理賠金額資料,發現少數案件金額極高。業務主管認為這些案件可能是真實重大事故,不一定是錯誤資料。資料分析人員最適當的處置為何?(A)不經確認直接刪除所有高額案件(B)先以統計方法與領域知識判斷是否為錯誤、合理極端值或需特殊處理的案例(C)將所有高額案件金額統一改為平均值(D)只要是離群值,就代表資料蒐集失敗
13.某行銷團隊完成顧客分群前,想先了解年齡分布、消費金額分布、欄位缺失狀況與變數間關聯。此階段最接近資料分析流程中的哪一項工作?(A)探索性資料分析(EDA)(B)模型正式部署(C)資料庫硬體採購(D)API權限開通
14.某能源公司以過去三年每小時用電量建立需求預測模型。工程師打算隨機切分訓練與測試資料,但資料主管提醒此方式可能使未來資料出現在訓練集中。下列哪一項做法最適當?(A)採用時間序列切分,依時間順序以較早資料訓練、較晚資料驗證或測試(B)將所有資料打亂後平均分配到訓練與測試集,以提高樣本均衡(C)只使用最近一天資料訓練模型,以避免資料量過大(D)將測試集結果回填到訓練集,以提高準確率
15.某醫療AI專案資料表包含姓名、身分證字號、手機號碼、診斷紀錄與檢查影像。若專案團隊要判斷個人資料與敏感資料風險,下列哪一項最正確?(A)姓名、身分證字號與手機號碼可直接識別個人,診斷紀錄也具有高度敏感性(B)只要資料用於研究,就不再屬於個人資料(C)影像資料不含文字,因此一定不涉及隱私(D)診斷紀錄只有醫師看得懂,所以不需保護
16.某公司將顧客資料提供給外部顧問進行模型分析,希望降低顧問直接識別個人的可能性,但仍保留後續必要時由公司內部對照回原始顧客的能力。下列哪一種作法最符合此需求?(A)去識別化且完全不可逆,刪除所有對照關係(B)假名化處理,將直接識別欄位替換為代碼並由公司保管對照表(C)不做任何處理,因為顧問簽約後即可取得所有資料(D)只將資料壓縮成ZIP檔即可達成隱私保護
17.某企業建立資料湖供不同部門分析使用。行銷部只需存取顧客分群與購買彙總資料,卻被授權可下載完整身分證字號與付款紀錄。若依資料安全治理原則,最適當的改善方向為何?(A)依最小權限原則重新設計角色權限,只授予完成工作所需資料(B)要求行銷部自行承諾不會查看敏感欄位即可(C)將所有資料開放給全公司,提升資料民主化(D)刪除所有資料湖資料,停止任何分析
18.某SaaS平台在使用者登入後傳輸報表資料,並將客戶資料長期保存在資料庫中。資安主管希望降低資料傳輸與儲存階段的外洩風險。下列哪一項措施最完整?(A)只在登入頁面使用密碼欄位,不需要其他保護(B)傳輸時使用TLS/HTTPS,儲存時採用資料庫或磁碟加密並妥善管理金鑰(C)只要系統放在雲端,就不需要加密(D)把資料表名稱改成英文縮寫即可避免外洩
19.某金融機構導入AI客服分析系統,主管要求所有查詢客戶資料的行為都能被追蹤,以便日後發生爭議時可查明誰在何時存取哪些資料。下列哪一項設計最能滿足此需求?(A)建立存取日誌與稽核軌跡,記錄使用者、時間、資料範圍與操作類型(B)只記錄系統每天總登入次數即可(C)要求員工口頭回報是否查詢資料(D)將所有資料匯出給主管保存,方便人工比對
20.某企業打算將客服對話資料用於訓練生成式AI助理。資料中可能包含客戶姓名、電話、地址、訂單編號與抱怨內容。若要在兼顧模型品質與隱私安全下進行資料準備,下列何者最適當?(A)直接使用原始對話訓練,避免破壞語意脈絡(B)先盤點個資欄位,取得或確認合法使用依據,進行遮蔽、去識別化或假名化,並限制存取與保留期間(C)只刪除電話號碼,其餘資料皆不可能識別個人(D)將資料複製到多人共用資料夾,方便各部門共同清理