44. 某企業將生成式 AI 導入內部知識問答系統,並建立強化學習從人類回饋(Reinforcement Learning from Human Feedback, RLHF)機制,定期依員工對 AI 生成答案的「按讚/按噓」評分作為後續微調模型的依據。系統上線半年後,資料分析部門發現,僅約 8% 員工會主動評分,且多數評分者集中於資訊部門,其他部門員工鮮少提供回饋。技術團隊對此現象應有的正確認知為何?
(A)生成式 AI 的回答主要受預訓練模型影響,因此 RLHF 回饋資料分布不均,通常不會明顯影響模型後續的回覆品質;
(B)RLHF 建立的獎勵模型(Reward Model)具有泛化能力,因此資訊部門的評分結果通常也能代表其他部門的需求;
(C)若資訊部門為 AI 系統的主要使用者,其回饋即可作為模型最佳化的主要依據,不必再蒐集其他部門的意見;
(D)回饋資料可能存在選擇性偏差,使模型逐漸偏向資訊部門的需求與用語習慣,因此應擴大不同部門的回饋樣本

答案:登入後查看
統計: 尚無統計資料