中文

基于分块推理的同时思考与交谈:面向口语语言模型的 STITCH

计算与语言 2026-02-10 v2 音频与语音处理

摘要

口语语言模型 (SLMs) 旨在接受语音输入并生成语音响应。然而,当前的 SLMs缺乏在作答前进行内部、无声思考的能力。相比之下,人类通常会通过内部复杂的推理过程来实现清晰简洁的表达,因此将无声思考过程集成到 SLMs 中具有高度的必要性。虽然直接生成完整的链式思维 (CoT) 推理再开始发言可以实现 SLMs 的思考功能,但这会导致语音响应具有额外的延迟,因为 CoT 推理过程长度任意。为解决此问题,我们提出了 Stitch—a一种新的生成方法,通过交替生成无声推理块和语音响应块来实现。由于语音响应块的音频时长远大于生成其 token 所需的时间,我们利用剩余的空闲时间来生成无声推理 token。当语音块播放给用户时,模型继续生成下一个无声推理块,从而实现同时思考与交谈。令人惊讶的是,Stitch 在不生成无声 CoT 的基线模型具有相同的延迟,同时在数学推理数据集上 outperform 这些基线 15%;Stitch 在非推理数据集上的表现也与这些基线模型相当。项目页面上提供了动画演示:https://d223302.github.io/STITCH。

关键词

引用

@article{arxiv.2507.15375,
  title  = {STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models},
  author = {Cheng-Han Chiang and Xiaofei Wang and Linjie Li and Chung-Ching Lin and Kevin Lin and Shujie Liu and Zhendong Wang and Zhengyuan Yang and Hung-yi Lee and Lijuan Wang},
  journal= {arXiv preprint arXiv:2507.15375},
  year   = {2026}
}

备注

ICLR 2026 camera-ready version. Project page: https://d223302.github.io/STITCH/