利用课程学习提升大语言模型的多对多语音到文本翻译能力
计算与语言
2025-06-17 v2
摘要
多模态大语言模型(MLLMs)在语音到文本翻译(S2TT)任务中取得了显著成功。虽然大多数现有研究聚焦于以英语为中心的翻译方向,但多对多翻译的探索仍受限于平行数据的稀缺。为解决这一问题,我们提出了一种三阶段课程学习策略,该策略利用大语言模型的机器翻译能力并将其适配到S2TT任务,从而在低资源场景下实现有效学习。我们训练了参数规模不同(3B、7B和32B)的MLLMs,并使用FLEURS和CoVoST-2数据集评估了所提出的策略。实验结果表明,所提出的策略在个语言对上实现了最先进的平均性能,每个语言仅需不到10小时的语音数据即可获得有竞争力的结果。源代码和模型已在https://github.com/yxduir/LLM-SRT发布。
关键词
引用
@article{arxiv.2409.19510,
title = {Making LLMs Better Many-to-Many Speech-to-Text Translators with Curriculum Learning},
author = {Yexing Du and Youcheng Pan and Ziyang Ma and Bo Yang and Yifan Yang and Keqi Deng and Xie Chen and Yang Xiang and Ming Liu and Bing Qin},
journal= {arXiv preprint arXiv:2409.19510},
year = {2025}
}
备注
Accepted in ACL 2025 (Main)