语音大语言模型全面接管:一种真正端到端的口语对话状态追踪方法
计算与语言
2026-02-17 v2 人工智能
机器学习
音频与语音处理
摘要
本文提出了一种基于语音大语言模型的端到端口语对话状态追踪上下文管理策略的比较研究。我们系统地评估了传统多模态上下文(结合文本历史和当前口语轮次)、完整口语历史和压缩口语历史方法。在 SpokenWOZ 语料库上的实验表明,提供完整口语对话作为输入在同等规模模型中取得了最高性能,显著超越了先前方法。此外,我们表明基于注意力池化的口语历史压缩提供了一种有力的折中方案,在减少上下文大小的同时保持了具有竞争力的准确率。详细分析证实,改进源于更有效的上下文利用。
引用
@article{arxiv.2510.09424,
title = {The Speech-LLM Takes It All: A Truly Fully End-to-End Spoken Dialogue State Tracking Approach},
author = {Nizar El Ghazal and Antoine Caubrière and Valentin Vielzeuf},
journal= {arXiv preprint arXiv:2510.09424},
year = {2026}
}
备注
Accepted for presentation at LREC 2026