后训练者的 multilingual 训练数据指南:揭示跨语言迁移动力学
计算与语言
2025-04-24 v1 人工智能
摘要
为了使大型语言模型在全球范围内实用,人们会对其进行微调,以便在多语言数据上遵循指令。尽管这种后训练技术广泛存在,但仍不清楚哪些动力学能够实现跨语言迁移。本研究探讨了在真实后训练环境中进行的跨语言迁移(CLT)动力学。我们研究了两种规模最高达350亿参数的模型家族,训练数据为精心控制的多语言数据混合物,在三个不同难度级别的生成任务(摘要生成、指令遵循和数学推理)中进行单任务和多任务指令调优。总体而言,我们发现跨语言迁移和多语言性能的动力学无法仅凭孤立变量来解释,具体取决于后训练设置的组合。最后,我们确定了实际情况下实现有效跨语言迁移的条件。
引用
@article{arxiv.2504.16677,
title = {A Post-trainer's Guide to Multilingual Training Data: Uncovering Cross-lingual Transfer Dynamics},
author = {Luisa Shimabucoro and Ahmet Ustun and Marzieh Fadaee and Sebastian Ruder},
journal= {arXiv preprint arXiv:2504.16677},
year = {2025}
}