中文

SimulS2S-LLM:解锁语音 LLM 同时推理的语音到语音翻译

计算与语言 2025-04-23 v1 声音 音频与语音处理

摘要

Simultaneous speech translation(SST)以流式语音输入并行输出翻译,在翻译质量和延迟之间进行权衡。虽然大型语言模型(LLM)已被扩展到处理语音模式,但流式处理仍具有挑战,因为语音被作为提示整合到整个生成过程中。为解锁 LLM 的流式功能,本文提出SimulS2S-LLM,该模型在离线训练语音 LLM,并采用测试时策略来指导同时推理。SimulS2S-LLM通过提取边界感知语音提示来缓解训练和推理之间的不匹配,从而更好地与文本输入数据匹配。SimulS2S-LLM通过预测离散输出语音标记并使用预训练的声学模型合成输出语音来实现同时语音到语音翻译(Simul-S2ST)。设计了一种递增束搜索,以在不增加延迟的情况下扩大语音标记预测的搜索空间。在CVSS语音数据上的实验表明,SimulS2S-LLM在使用相同训练数据的现有方法之上,提供了更好的翻译质量-延迟权衡,例如在类似延迟下将 ASR-BLEU 分数提高3分。

关键词

引用

@article{arxiv.2504.15509,
  title  = {SimulS2S-LLM: Unlocking Simultaneous Inference of Speech LLMs for Speech-to-Speech Translation},
  author = {Keqi Deng and Wenxi Chen and Xie Chen and Philip C. Woodland},
  journal= {arXiv preprint arXiv:2504.15509},
  year   = {2025}
}