AI研究 2026-01-29 タグ: cs.CL, cs.AI, cs.IR, cs.SE

「より良い」プロンプトが逆効果になる時：LLMアプリのための評価主導型反復プロセス

要約

LLMアプリ開発における評価主導型ワークフロー（定義、テスト、診断、修正）と、推奨評価セットであるMVESを提案する研究である。実験では、一般的に「改良された」とされるプロンプトが、特定のタスク（抽出やRAG準拠）の性能を低下させるトレードオフが確認された。万能なプロンプトではなく、評価に基づいた反復改善の重要性を示している。

全文は有料プランで閲覧できます。

Unlock

全文は有料プラン限定です

ログインして試す

Pro

深掘りチャットで“理解の履歴”を残す

プランを見る

Proなら長文回答とスレッド保存で、論文ごとの知識DBを作れます。

「より良い」プロンプトが逆効果になる時：LLMアプリのための評価主導型反復プロセス

要約

全文は有料プラン限定です

深掘りチャットで“理解の履歴”を残す

次に読む