中文

面向流式全双工端到端口语对话系统的链条式推理

计算与语言 2025-10-03 v1 声音 音频与语音处理

摘要

大多数端到端(E2E)口语对话系统(SDS)依赖于语音活动检测(VAD)用于轮次控制,但 VAD 难以区分停顿和轮次完成。双工 SDS 模型通过预测连续输出(包括静音 token)来解决这一问题,从而无需显式的 VAD。然而,它们常常具有复杂的双通道架构,并且在语义推理方面滞后于级联模型。为克服这些挑战,我们提出了 SCoT:一个用于双工 SDS 的流式链条式推理(CoT)框架,交替进行固定时长用户输入的处理和以块状方式生成响应。利用帧级对齐,我们为每个块创建中介目标对齐的用户转录和系统响应。实验表明,我们的方法比现有双工方法产生更连贯、更可解释的响应,同时支持比轮次制为系统更低的延迟和重叠交互。

关键词

引用

@article{arxiv.2510.02066,
  title  = {Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems},
  author = {Siddhant Arora and Jinchuan Tian and Hayato Futami and Jiatong Shi and Yosuke Kashiwagi and Emiru Tsunoo and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2510.02066},
  year   = {2025}
}