Reinforcement Learning from Human Feedback
人間のフィードバックからの強化学習人間が複数の出力を比較したり、望ましい回答例を示したりして、その評価をモデルの学習に使う方法です。ユーザー意図への適合を高める狙いがありますが、評価基準やデータの偏りが学習結果に影響します。
公式・公的資料で確認Reinforcement Learning from Human Feedbackは、人間が示した回答の好ましさや順位を学習データとして使い、モデルが高く評価される出力を選びやすくする方法です。代表的な構成では、模範回答による教師あり学習、出力を比較する報酬モデルの学習、その報酬を使う強化学習を組み合わせます。人間の評価が何を良いとするかを反映できる一方、評価者間の違い、課題の偏り、報酬モデルの誤りを含む可能性があります。 RLHFは、人間の評価をモデルの出力方針へ反映するための学習手法として研究されました。 人間が望ましい出力を比較・評価し、その情報を報酬モデルや強化学習へ利用して指示への適合を高めます。 現在は評価者やデータの偏り、報酬設計、用途ごとの基準を確認し、安全性や正確性の保証とは分けて扱います。