超越数据量:驱动多语言语言模型性能的关键因素
计算与语言
2024-12-18 v1 人工智能
摘要
多语言语言模型 (MLLMs) 对于处理跨多种语言的文本至关重要,然而由于资源可用性和语言特征的差异,它们常表现出性能差异。尽管预训练数据百分比和模型大小对性能的影响已为人熟知,我们的研究揭示了显著影响 MLLM 有效性的其他关键因素。通过分析包括地理、语言和资源相关方面在内的广泛特征,我们聚焦于用于分类的 SIB-200 数据集和用于机器翻译的 Flores-200 数据集,在 204 种语言上使用回归模型和 SHAP 值进行分析。我们的研究发现,除了预训练数据和模型大小外,token 相似性和国家相似性也是提升模型性能的关键因素。token 相似性促进了跨语言迁移,而国家相似性则凸显了共享文化和语言背景的重要性。这些见解为开发更公平、更有效的多语言语言模型提供了宝贵指导,特别是对于代表性不足的语言。
引用
@article{arxiv.2412.12500,
title = {Beyond Data Quantity: Key Factors Driving Performance in Multilingual Language Models},
author = {Sina Bagheri Nezhad and Ameeta Agrawal and Rhitabrat Pokharel},
journal= {arXiv preprint arXiv:2412.12500},
year = {2024}
}
备注
Accepted at The First Workshop on Language Models for Low-Resource Languages @ COLING 2025