FuxiMT:稀疏化大型语言模型用于中文中心多语言机器翻译
计算与语言
2025-05-21 v1 人工智能
摘要
本文提出FuxiMT,一个以稀疏化大型语言模型(LLM)为驱动的中文中心多语言机器翻译模型。我们采用两阶段策略训练FuxiMT。首先,在大型中文语料库上进行预训练,然后在覆盖65种语言的大型平行数据集上进行多语言微调。FuxiMT集成了混合专家(Mixture-of-Experts, MoEs)模型,并采用课程学习策略以确保在不同资源水平下的稳健性能。实验结果表明,FuxiMT显著优于强大的基准模型,包括最先进的LLM和机器翻译模型,尤其在低资源场景下表现更为突出。此外,FuxiMT在未见语言对上展现出惊人的零样翻译能力,表明其有潜力在平行数据稀缺或不可用的场景中弥合沟通鸿沟。
引用
@article{arxiv.2505.14256,
title = {FuxiMT: Sparsifying Large Language Models for Chinese-Centric Multilingual Machine Translation},
author = {Shaolin Zhu and Tianyu Dong and Bo Li and Deyi Xiong},
journal= {arXiv preprint arXiv:2505.14256},
year = {2025}
}