ATLAS: 多语言预训练、微调与解码的自适应传递标度定律
材料科学
2025-10-28 v1
摘要
标度定律研究主要聚焦于英语, 而最新流行的人工智能模型显然服务数十亿国际用户. 本文开展了规模最大的多语言标度定律研究, 共计774次多语言训练实验, 覆盖10M-8B模型参数, 400+训练语言及48评估语言. 我们引入自适应传递标度定律(ATLAS), 适用于单语和多语言预训练, 在超出样本泛化方面常比现有标度定律高出0.3以上的R². 我们对实验数据进行分析, 揭示多语言学习动力学、语言间传递特性以及多语言诅咒. 首先, 我们推导语言间传递矩阵, 经验性地测量38x38=1444个语言对之间的相互获益分数. 其次, 我们推导无语言依赖的标度定律, 揭示在增加语言而不牺牲性能时的模型规模和数据的最优标度方法. 此外, 我们确定何时从头预训练 versus 从多语言检查点进行微调的计算临界点. 我们希望这些发现为跨语言 democratize 标度定律提供科学基础, 并使实践者能够高效扩展模型 — — 不局限于英语优先的人工智能.
引用
@article{arxiv.2510.22036,
title = {Nonlinear phononic slidetronics},
author = {Pooja Rani and Dominik M. Juraschek},
journal= {arXiv preprint arXiv:2510.22036},
year = {2025}
}