面向开放端到端口语对话系统的思维链训练
计算与语言
2025-06-03 v1 声音
音频与语音处理
摘要
与传统的级联流水线不同,端到端(E2E)口语对话系统保持了完全的可微性,并能够捕获非音素信息,使其非常适合对口语交互进行建模。然而,现有的 E2E 方法通常需要大规模训练数据,且生成的响应缺乏语义连贯性。我们提出了一种简单而有效的策略,利用思维链表述,确保对话数据上的训练与多模态语言模型(LM)在语音识别(ASR)、文本到语音合成(TTS)和文本 LM 任务上的预训练保持密切一致。我们的方法比基线实现了超过 1.5 的 ROUGE-1 提升,成功在公开的人人对话数据集上训练了口语对话系统,同时计算效率足够高,仅需 300 小时的公开人人对话数据(如 Switchboard)即可进行训练。我们将公开发布我们的模型和训练代码。
引用
@article{arxiv.2506.00722,
title = {Chain-of-Thought Training for Open E2E Spoken Dialogue Systems},
author = {Siddhant Arora and Jinchuan Tian and Hayato Futami and Jee-weon Jung and Jiatong Shi and Yosuke Kashiwagi and Emiru Tsunoo and Shinji Watanabe},
journal= {arXiv preprint arXiv:2506.00722},
year = {2025}
}
备注
Accepted at INTERSPEECH 2025