中文

利用课程学习提升大语言模型的多对多语音到文本翻译能力

计算与语言 2025-06-17 v2

摘要

多模态大语言模型(MLLMs)在语音到文本翻译(S2TT)任务中取得了显著成功。虽然大多数现有研究聚焦于以英语为中心的翻译方向,但多对多翻译的探索仍受限于平行数据的稀缺。为解决这一问题,我们提出了一种三阶段课程学习策略,该策略利用大语言模型的机器翻译能力并将其适配到S2TT任务,从而在低资源场景下实现有效学习。我们训练了参数规模不同(3B、7B和32B)的MLLMs,并使用FLEURS和CoVoST-2数据集评估了所提出的策略。实验结果表明,所提出的策略在15×1415\times14个语言对上实现了最先进的平均性能,每个语言仅需不到10小时的语音数据即可获得有竞争力的结果。源代码和模型已在https://github.com/yxduir/LLM-SRT发布。

关键词

引用

@article{arxiv.2409.19510,
  title  = {Making LLMs Better Many-to-Many Speech-to-Text Translators with Curriculum Learning},
  author = {Yexing Du and Youcheng Pan and Ziyang Ma and Bo Yang and Yifan Yang and Keqi Deng and Xie Chen and Yang Xiang and Ming Liu and Bing Qin},
  journal= {arXiv preprint arXiv:2409.19510},
  year   = {2025}
}

备注

Accepted in ACL 2025 (Main)