中文

面向开放端到端口语对话系统的思维链训练

计算与语言 2025-06-03 v1 声音 音频与语音处理

摘要

与传统的级联流水线不同,端到端(E2E)口语对话系统保持了完全的可微性,并能够捕获非音素信息,使其非常适合对口语交互进行建模。然而,现有的 E2E 方法通常需要大规模训练数据,且生成的响应缺乏语义连贯性。我们提出了一种简单而有效的策略,利用思维链表述,确保对话数据上的训练与多模态语言模型(LM)在语音识别(ASR)、文本到语音合成(TTS)和文本 LM 任务上的预训练保持密切一致。我们的方法比基线实现了超过 1.5 的 ROUGE-1 提升,成功在公开的人人对话数据集上训练了口语对话系统,同时计算效率足够高,仅需 300 小时的公开人人对话数据(如 Switchboard)即可进行训练。我们将公开发布我们的模型和训练代码。

关键词

引用

@article{arxiv.2506.00722,
  title  = {Chain-of-Thought Training for Open E2E Spoken Dialogue Systems},
  author = {Siddhant Arora and Jinchuan Tian and Hayato Futami and Jee-weon Jung and Jiatong Shi and Yosuke Kashiwagi and Emiru Tsunoo and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2506.00722},
  year   = {2025}
}

备注

Accepted at INTERSPEECH 2025