XDoGE:多语言数据重加权以提升大语言模型中的语言包容性
计算与语言
2025-12-12 v1
摘要
当前的大型语言模型(LLM)是在大量文本数据上训练的,主要来自少数几种主导语言。研究表明,这种对高资源语言(如英语)的过度依赖会损害在中等和低资源语言上的 LLM 性能。为缓解此问题,我们提出方案:(i)通过扩展应用于多语言设置的领域重加权 DoGE 算法,以 XDoGE 形式训练小型代理模型来优化语言分布;(ii)使用 established 的语言权重对数据进行比例缩放,并从头或在持续预训练阶段(CPT)中训练完整规模的模型。我们目标包括六种具有不同地理位置及内部和外部语言族关系的语言,即英语和西班牙语(高资源),葡萄牙语和加泰罗尼亚语(中资源),加利西亚语和巴斯克语(低资源)。我们使用 Salamandra-2b 模型进行实验,该模型在这些语言方面表现有前景。我们通过 IberoBench 框架,对小语言中大量数据重复和主导语言中欠采样的效果进行定量评估。最后,我们发布了一个新的有前景的 IberianLLM-7B-Instruct 模型,聚焦伊比利亚语和英语,该模型使用 XDoGE 权重从头预训练并通过 CPT 进一步优化。
引用
@article{arxiv.2512.10545,
title = {XDoGE: Multilingual Data Reweighting to Enhance Language Inclusivity in LLMs},
author = {Iñaki Lacunza and José Javier Saiz and Alexander Shvets and Aitor Gonzalez-Agirre and Marta Villegas},
journal= {arXiv preprint arXiv:2512.10545},
year = {2025}
}
备注
Accepted and presented at the LLMs4All workshop at the IEEE BigData 2025 Conference, Macau - December 8-11, 2025