系统探讨多语言性在 LLM 后训练中的作用
计算与语言
2026-04-16 v1 人工智能
摘要
尽管大语言模型在多语言部署方面已广泛普及, 但后训练管道仍以英文为主, 导致不同语言间的性能差异。我们进行了一项系统、受控的研究, 探讨训练语言覆盖范围、模型规模与任务域之间的相互作用。该研究基于 220 项监督微调实验, 使用跨语言平行翻译数据混合物进行, 涵盖数学推理和 API 调用任务, 模型规模可达 80 亿参数。我们发现, 在后训练中增加语言覆盖范围对所有任务和模型规模均有显著益处, 低资源语言受益最大, 高资源语言则趋于平台, 而非下降。即便最低限度的多语言性也有帮助: 将单一非英文语言纳入训练, 可提升英文性能和跨语言泛化, 使仅用英文进行后训练显得次要。此外, 在足够的语言多样性下, 零样本跨语言迁移可匹配或超过在低多样性情景下直接包含语言的效果, 尽管对类型学上遥远且资源匮乏的语言收益仍有限。
引用
@article{arxiv.2604.13286,
title = {English is Not All You Need: Systematically Exploring the Role of Multilinguality in LLM Post-Training},
author = {Mehak Dhaliwal and Shashwat Chaurasia and Yao Qin and Dezhi Hong and Thomas Butler},
journal= {arXiv preprint arXiv:2604.13286},
year = {2026}
}