中文

SALM-Duplex:面向语音到语音语言模型的高效直接双工建模

计算与语言 2025-07-28 v4 声音 音频与语音处理

摘要

语音对话是人机交互的直观形式,但当前的语音语言模型往往受限于轮次式交互,缺乏实时适应性,如用户抢占输入。我们提出一种新型语音到语音(S2S)双工架构, featuring continuous user inputs and codec agent outputs with channel fusion that directly models simultaneous user and agent streams。使用预训练的流式编码器处理用户输入,实现首个无需语音预训练的双工 S2S 模型。针对 agent 和 user 的分离建模架构促进 codec 微调以获得更好的 agent 声线,并将比特率降低一半(0.6 kbps),相较于前作。实验结果表明,所提模型在推理、轮次衔接和抢占能力方面均优于以前的双工模型。该模型所需的语音数据显著减少,因无需语音预训练,显著简化了从任意大语言模型构建双工 S2S 模型的过程。最后,它是首个公开的双工 S2S 模型,包含训练和推理代码以促进可重复性。

关键词

引用

@article{arxiv.2505.15670,
  title  = {SALM-Duplex: Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model},
  author = {Ke Hu and Ehsan Hosseini-Asl and Chen Chen and Edresson Casanova and Subhankar Ghosh and Piotr Żelasko and Zhehuai Chen and Jason Li and Jagadeesh Balam and Boris Ginsburg},
  journal= {arXiv preprint arXiv:2505.15670},
  year   = {2025}
}

备注

Accepted to Interspeech 2025