中文

通过对齐语音编码器与 LLM 接近对话状态追踪

音频与语音处理 2025-06-11 v1 计算与语言

摘要

本工作通过一个小型连接器模块桥接语音编码器与 LLM 的表示空间,探讨口语对话状态追踪(DST),重点关注完全开源的组件(WavLM-large、OLMo)。我们重点消融了此类系统的不同方面,包括全量/LoRA 适配器微调、对话历史中智能体轮次的影响,以及基于模糊匹配的输出后处理,后者显著提升了系统在对话槽值命名实体上的性能。我们在 SpokenWOZ 数据集上进行实验,并额外利用 Speech-Aware MultiWOZ 数据集扩充训练数据。最终,我们表现最佳的 WavLM + 连接器 + OLMo-1B 对齐模型在 SpokenWOZ 测试集上达到最先进水平(34.66% JGA),而采用 Gemma-2-9B-instruct 的系统进一步超越该结果,在 SpokenWOZ 测试集上达到 42.17% JGA。

关键词

引用

@article{arxiv.2506.08633,
  title  = {Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs},
  author = {Šimon Sedláček and Bolaji Yusuf and Ján Švec and Pradyoth Hegde and Santosh Kesiraju and Oldřich Plchot and Jan Černocký},
  journal= {arXiv preprint arXiv:2506.08633},
  year   = {2025}
}

备注

Accepted to Interspeech 2025