中文

Marco-LLM:通过大规模多语言训练实现跨语言桥接以提升跨语言性能

计算与语言 2024-12-06 v1

摘要

大型语言模型(LLM)近年来取得了显著的进展;然而其优异性能仍主要局限于主要世界语言,尤其是英文。许多LLM在多语言任务中仍面临挑战,尤其是在低资源语言方面。为此,我们提出了Marco-LLM:大规模多语言训练用于跨语言增强的LLM。我们收集了针对几种低资源语言的大量多语言数据,并对Qwen2模型进行了大规模的持续预训练。最终我们得到了一个名为Marco-LLM的多语言LLM。通过在各种多语言基准测试上的全面评估,包括MMMLU、AGIEval、Belebele、Flores-200、XCOPA等,Marco-LLM在多个方面均显著优于现有的SOTA LLM。此外,Marco-LLM在任何到任何的机器翻译任务中实现了显著的提升,显示现我们多语言LLM的有效性。Marco-LLM是一种 pioneering 多语言LLM,旨在不仅在多语言任务(包括低资源语言)中表现卓越,而且在英文和其他主要语言中保持强大的性能,从而缩小高资源语言和低资源语言能力之间的差距。通过桥接语言,此项工作展示了我们致力于确保LLMs在各种语言中准确工作的承诺。

关键词

引用

@article{arxiv.2412.04003,
  title  = {Marco-LLM: Bridging Languages via Massive Multilingual Training for Cross-Lingual Enhancement},
  author = {Lingfeng Ming and Bo Zeng and Chenyang Lyu and Tianqi Shi and Yu Zhao and Xue Yang and Yefeng Liu and Yiyu Wang and Linlong Xu and Yangyang Liu and Xiaohu Zhao and Hao Wang and Heng Liu and Hao Zhou and Huifeng Yin and Zifu Shang and Haijun Li and Longyue Wang and Weihua Luo and Kaifu Zhang},
  journal= {arXiv preprint arXiv:2412.04003},
  year   = {2024}
}