心节奏 Speaking:双脑实时推理口语模型方法
计算与语言
2026-05-12 v2
摘要
实时口语模型(SLMs)在因顺序生成整个思维过程的延迟过高问题下,难以利用链律思考(CoT)。使 SLMs 能够类似人类一样在说话时思考,正受到日益关注。我们首次提出心节奏 Speaking(MPS),一种受大脑启发的框架,实现高保真实时推理。类似于人类利用不同脑区进行思考和回应的方式,我们提出一种新颖的双脑方法,采用“思考脑”进行高层次推理以节奏和指导单独的“发音脑”进行流畅语音生成。这种分工消除了模式切换,保留了推理过程的完整性。实验表明,MPS显著优于现有思考式发言方法,在大幅降低延迟的同时,实现了与在说话前预计算完整 CoT 的模型相当的推理性能。在零延迟配置下,所提方法在数学推理任务 Spoken-MQA 上实现了92.8%的准确率,并在语音对话任务 URO-Bench 上取得82.5分。MPS 是我们发布的 Step-Audio R1.1 系统的核心方法,有效弥合了高质量推理与实时交互之间的差距。
引用
@article{arxiv.2510.09592,
title = {Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models},
author = {Donghang Wu and Haoyang Zhang and Jun Chen and Xiangyu and Zhang and Hexin Liu and Eng Siong Chng and Fei Tian and Xuerui Yang and Xiangyu Zhang and Daxin Jiang and Gang Yu},
journal= {arXiv preprint arXiv:2510.09592},
year = {2026}
}