中文

面向LLM的语音到语音翻译的渐进式交错语音-文本训练

计算与语言 2025-06-13 v1 声音 音频与语音处理

摘要

语音到语音翻译(S2ST)已通过大型语言模型(LLMs)取得进展,这些模型在离散语音单元上进行微调。在此类方法中,从文本到语音的模态适配一直是一个问题。LLMs 仅在文本数据上进行训练,这使其在语音数据有限的情况下难以适配到语音模态。为解决训练困难,本研究提出了渐进式交错语音-文本训练。我们使用交错的语音-文本单元而非语音单元进行训练,在词级别插入对齐的文本令牌。随着训练的推进,我们逐步降低文本的比例,以促进从文本到语音的渐进式模态适配。我们通过对 CVSS 数据集上的 LLaMA3.2-1B 进行微调来进行实验评估。结果表明,所提出的方法持续改善了翻译性能,尤其对于训练数据有限的语言。

关键词

引用

@article{arxiv.2506.10299,
  title  = {Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs},
  author = {Hayato Futami and Emiru Tsunoo and Yosuke Kashiwagi and Yuki Ito and Hassan Shahmohammadi and Siddhant Arora and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2506.10299},
  year   = {2025}
}

备注

Accepted to Interspeech2025