Babel:覆盖全球 90% 说话人口的开源多语言大语言模型
计算与语言
2025-03-04 v1 人工智能
摘要
大型语言模型(LLM)已彻底改变自然语言处理(NLP),但开源多语言 LLM 仍稀缺,现有模型在语言覆盖范围上常受限。这些模型通常优先考虑资源丰富的语言,而忽视了被大量说话人口使用但资源匮乏的语言。为解决这一差异,我们提出 ,一种覆盖按说话人数排名前 25 位语言、支持全球 90% 人口并包含其他开源多语言 LLM 所忽视的众多语言的开源多语言 LLM。不同于传统继续预训练方法,Babel 通过层扩展技术扩大参数规模,提升 Babel 的性能上限。我们引入两个变体: 用于高效推理和微调, 设定了开源多语言 LLM 的新标准。广泛的多语言任务评估表明,其性能优于规模相似的开源 LLM。此外,利用开源监督式微调数据集,Babel 实现了卓越的性能,Babel-9B-Chat 在 10B 规模 LLM 中领先,Babel-83B-Chat 在多语言任务上达到与商业模型相同的水平。
引用
@article{arxiv.2503.00865,
title = {Babel: Open Multilingual Large Language Models Serving Over 90% of Global Speakers},
author = {Yiran Zhao and Chaoqun Liu and Yue Deng and Jiahao Ying and Mahani Aljunied and Zhaodonghui Li and Lidong Bing and Hou Pong Chan and Yu Rong and Deli Zhao and Wenxuan Zhang},
journal= {arXiv preprint arXiv:2503.00865},
year = {2025}
}