条件付きバリュー・アット・リスク(CVaR)の方策勾配法は、テールの性能に焦点を当てるためサンプル効率が悪いという課題がある。本研究では、CVaRに期待分位点項を追加することで、すべてのサンプリングデータを利用可能な動的計画法を導入し、サンプル効率を改善する手法を提案する。実験により、この手法が既存手法を一貫して上回ることが示された。
全文は有料プランで閲覧できます。
Unlock
Pro
Proなら長文回答とスレッド保存で、論文ごとの知識DBを作れます。
Related