42. 某客服系統開發團隊希望聊天機器人的回覆風格更貼近人類偏好,因此在模型訓練後期導入人類回饋強化學習(Reinforcement Learning from Human Feedback, RLHF)技術。關於 RLHF 核心作法,下列敘述何者最正確?
(A)蒐集人類對不同模型回覆的偏好評比,建立獎勵模型作為模型優化的依據;
(B)蒐集更大量的公開網路文字重新進行預訓練,以提升模型回答的專業度;
(C)調整系統提示(System Prompt),引導模型採用指定的回覆風格;
(D)蒐集高品質問答範例,直接進行監督式微調(Supervised Fine-Tuning, SFT)

答案:登入後查看
統計: A(1), B(0), C(0), D(0), E(0) #4037336