FuxiTranyu:使用平衡数据训练的多语言大型语言模型
计算与语言
2024-10-29 v3
摘要
大型语言模型(LLM)在广泛的任务中展现出强大的能力。然而,许多 LLM 在高资源语言和低资源语言之间表现存在显著差异。为缓解这一挑战,我们提出FuxiTranyu,一款开源多语言 LLM,旨在满足研究社区对平衡且高性能多语言能力的需求。基础模型FuxiTranyu-8B包含80亿参数,基于包含43种自然语言和16种编程语言、覆盖6000亿token的精心平衡的多语言数据从头训练。我们还开发了两个指令调优模型:FuxiTranyu-8B-SFT 在多样化的多语言指令数据集上进行微调,FuxiTranyu-8B-DPO 进一步在偏好数据集上进行 DPO 优化以提升对齐能力。广泛的实验表明,FuxiTranyu在多语言基准测试上的表现与现有的多语言 LLM(如BLOOM-7B、PolyLM-13B和Mistral-7B-Instruct)相媲美。两种神经元和表示可解释性分析均表明FuxiTranyu在语言间实现一致的多语言表示。为促进多语言 LLM 的进一步研究,我们在 HuggingFace(见 https://huggingface.co/TJUNLP/FuxiTranyu-8B)和 GitHub(见 https://github.com/tjunlp-lab/FuxiTranyu)上发布了基础模型和指令调优模型,以及58个预训练检查点。
关键词
引用
@article{arxiv.2408.06273,
title = {FuxiTranyu: A Multilingual Large Language Model Trained with Balanced Data},
author = {Haoran Sun and Renren Jin and Shaoyang Xu and Leiyu Pan and Supryadi and Menglong Cui and Jiangcun Du and Yikun Lei and Lei Yang and Ling Shi and Juesi Xiao and Shaolin Zhu and Deyi Xiong},
journal= {arXiv preprint arXiv:2408.06273},
year = {2024}
}
备注
Accepted to EMNLP 2024 Industry Track