探索多语言和谐:大语言模型预训练中的多语言数据分配
计算与语言
2025-09-22 v1 人工智能
摘要
大语言模型(LLMs)已成为全球范围内广泛应用的核心组件,推动了对有效多语言能力的前所未有的需求。实现稳健的多语言性能的核心在于战略性地分配训练语料库中的语言比例。然而,确定最佳语言比率极具挑战性 due to 复杂的跨语言相互作用 and 对数据规模的敏感性。本文引入了 Climb(Cross-Lingual Interaction-aware Multilingual Balancing),一个旨在系统性优化多语言数据分配的新框架。Climb 的核心引入了跨语言相互作用感知的语言比例,显式地通过捕捉语言间依赖关系来量化每个语言的有效分配。借助该比例,Climb 提出了原则性的两步优化程序—首先在跨语言之间平等化边际收益,然后最大化 resulting language allocation vectors 的幅度—显著简化了固有的复杂多语言优化问题。广泛实验确认,Climb 能够准确地衡量各种多语言设置中的跨语言相互作用。使用 Climb 导出的比例训练的 LLMs 持续实现最先进的多语言性能,甚至在使用更多 token 的开源 LLMs 中也能实现具竞争力的性能。
引用
@article{arxiv.2509.15556,
title = {Exploring Polyglot Harmony: On Multilingual Data Allocation for Large Language Models Pretraining},
author = {Ping Guo and Yubing Ren and Binbin Liu and Fengze Liu and Haobin Lin and Yifan Zhang and Bingni Zhang and Taifeng Wang and Yin Zheng},
journal= {arXiv preprint arXiv:2509.15556},
year = {2025}
}