LOLA——一个开源的大规模多语言大语言模型
计算与语言
2025-02-04 v7 人工智能
机器学习
摘要
本文介绍了LOLA,一个使用稀疏混合专家Transformer架构在超过160种语言上训练的大规模多语言大语言模型。我们的架构和实现选择旨在解决利用语言多样性的挑战,同时保持效率并避免多语言处理的常见陷阱。我们对评估结果的分析显示,该模型在自然语言生成和理解任务中表现出有竞争力的性能。此外,我们展示了学习到的专家路由机制如何利用隐含的系统发育语言模式,从而可能缓解多语言诅咒。我们深入探讨了训练过程,分析了数据集,并平衡地探索了模型的优势与局限。作为一个开源模型,LOLA促进了可复现性,并为未来的研究奠定了坚实的基础。我们的发现有助于开发计算高效的多语言模型,这些模型在不同语言间具有强大且可扩展的性能。
引用
@article{arxiv.2409.11272,
title = {LOLA -- An Open-Source Massively Multilingual Large Language Model},
author = {Nikit Srivastava and Denis Kuchelev and Tatiana Moteu Ngoli and Kshitij Shetty and Michael Röder and Hamada Zahera and Diego Moussallem and Axel-Cyrille Ngonga Ngomo},
journal= {arXiv preprint arXiv:2409.11272},
year = {2025}
}