中文

SLM-S2ST:用于直接语音到语音翻译的多模态语言模型

音频与语音处理 2026-02-12 v3

摘要

语音感知语言模型(LMs)已展示出理解 spoken language 并生成基于文本的响应的能力。然而,使其高效有效地产生语音输出仍然是一个挑战。本文提出 SLM-S2ST,这是一个用于直接语音到语音翻译(S2ST)的多模态 LM,基于开源 Phi4-MM 模型构建。SLM-S2ST 通过一个音频转换器头来生成译后语音,该头相对于文本 token 具有延迟,随后通过流式声码器进行波形合成。我们的实验结果表明,SLM-S2ST 在 CVSS-C 数据集上性能显著优于现有基线模型。此外,当我们扩大训练数据和模型规模时,SLM-S2ST 能与当前 SOTA 模型持平。

关键词

引用

@article{arxiv.2506.04392,
  title  = {SLM-S2ST: A multimodal language model for direct speech-to-speech translation},
  author = {Yuxuan Hu and Haibin Wu and Ruchao Fan and Xiaofei Wang and Heng Lu and Yao Qian and Jinyu Li},
  journal= {arXiv preprint arXiv:2506.04392},
  year   = {2026}
}

备注

Accepted by ASRU 2025