エージェント強化学習における報酬の課題に対処するため、構造化されたフィードバックを提供する「Agent Reasoning Reward Model (Agent-RRM)」が提案された。このモデルは推論の過程、欠陥への批判、全体スコアを出力し、これらを統合した手法「Reagent-U」はGAIAなどのベンチマークで大幅な性能向上を達成した。
全文は有料プランで閲覧できます。
Unlock
Pro
Proなら長文回答とスレッド保存で、論文ごとの知識DBを作れます。
Related