Reinforcement Learning from Human Feedback
人間のフィードバックからの強化学習人間が複数の出力を比較したり、望ましい回答例を示したりして、その評価をモデルの学習に使う方法です。ユーザー意図への適合を高める狙いがありますが、評価基準やデータの偏りが学習結果に影響します。
公式・公的資料で確認読み方は「アールエルエイチエフ」。意味と使われ方を根拠つきで確認できます。
公式・公的資料で確認
RLHFは、Reinforcement Learning from Human Feedbackの略で、人間が示した望ましさの評価を報酬として使い、モデルの出力方針を調整する方法です。人間の意図に近づける目的で使われますが、評価者、データ、報酬設計の偏りを引き継ぐ可能性があります。
人間の評価を使ってAIの出力方針を調整する学習方法
分野別の意味
人間が複数の出力を比較したり、望ましい回答例を示したりして、その評価をモデルの学習に使う方法です。ユーザー意図への適合を高める狙いがありますが、評価基準やデータの偏りが学習結果に影響します。
公式・公的資料で確認掲載データの使用場面
断定を避けるポイント
InstructGPT論文で、模範回答・順位づけ・強化学習を組み合わせる工程を確認した。人間の意図に完全一致することや安全性の保証とは分けて記録する。
正式名称と用法
同じ分野・使用文脈から探す
確認日・出典
公式・公的資料で確認
最終確認2026/8/21
調査した根拠と項目別の確認履歴をもとに掲載しています。
正式名称、意味、使われる分野を分けて記録しています。