中文

在语音到语音生成中保持语音到文本LLM能力

音频与语音处理 2026-06-29 v1 声音

摘要

强大的语音到文本(S2T)LLM已经提供了稳健的语音感知和文本推理,但添加语音到语音(S2S)输出具有挑战性:微调骨干网络可能会降低原始S2T性能,而附加下游说话者会重新引入串行文本到语音瓶颈。我们提出了PRIME-Speech,一个冻结骨干的S2S转换框架,仅训练语音生成模块。PRIME-Speech将因果音频后解码器与冻结骨干的中间隐藏状态同步,因此码本令牌是从模型不断演化的推理轨迹生成的,而不是从完成的文本块生成的。后解码器使用混合隐藏状态、文本和音频历史条件,以及训练时的打包策略,配合回合级音频KV缓存和位置重置,稳定多轮口语交互,而无需额外的多轮S2S训练数据。多令牌预测进一步降低了有效码本预测率,并改善了首音频延迟,而无需修改推理路径。在语音翻译、口语问答、语音理解和多轮对话中,PRIME-Speech保持了冻结骨干的S2T行为,同时产生准确、低WER的口语响应。

关键词

引用

@article{arxiv.2606.30944,
  title  = {Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation},
  author = {Yuxuan Hu and Heng Lu and Ruchao Fan and Yao Qian and Xiaofei Wang and Jian Xue and Heming Wang and Shuohang Wang and Young Jin Kim and Yelong Shen and Jinyu Li},
  journal= {arXiv preprint arXiv:2606.30944},
  year   = {2026}
}