面向LLM的语音到语音翻译的渐进式交错语音-文本训练
计算与语言
2025-06-13 v1 声音
音频与语音处理
摘要
语音到语音翻译(S2ST)已通过大型语言模型(LLMs)取得进展,这些模型在离散语音单元上进行微调。在此类方法中,从文本到语音的模态适配一直是一个问题。LLMs 仅在文本数据上进行训练,这使其在语音数据有限的情况下难以适配到语音模态。为解决训练困难,本研究提出了渐进式交错语音-文本训练。我们使用交错的语音-文本单元而非语音单元进行训练,在词级别插入对齐的文本令牌。随着训练的推进,我们逐步降低文本的比例,以促进从文本到语音的渐进式模态适配。我们通过对 CVSS 数据集上的 LLaMA3.2-1B 进行微调来进行实验评估。结果表明,所提出的方法持续改善了翻译性能,尤其对于训练数据有限的语言。
引用
@article{arxiv.2506.10299,
title = {Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs},
author = {Hayato Futami and Emiru Tsunoo and Yosuke Kashiwagi and Yuki Ito and Hassan Shahmohammadi and Siddhant Arora and Shinji Watanabe},
journal= {arXiv preprint arXiv:2506.10299},
year = {2025}
}
备注
Accepted to Interspeech2025