自然な音声対話を実現するため、複雑な対話を最小単位の会話ユニットに分解して処理するフレームワークを提案しています。マルチモーダル大規模言語モデル(LLM)を中心としたセミカスケード型システムにより、トレーニング不要かつプラグアンドプレイでの動作を実現。HumDialデータセットを用いた実験で高い有効性が示されています。
全文は有料プランで閲覧できます。
Unlock
Pro
Proなら長文回答とスレッド保存で、論文ごとの知識DBを作れます。
Related