中文

探索和扩展代码切换在多语言语言模型预训练中的作用

计算与语言 2025-04-23 v2

摘要

大型语言模型(LLMs)尽管在预训练数据中存在严重的语言不平衡,仍表现出惊人的多语言能力。在本文中,我们密切关注这种现象的原因,聚焦于预训练语料库。我们发现,代码切换(即在同一语境中在不同语言之间交替)是多语言能力的关键因素。我们对预训练语料库中的代码切换进行分析,检查其存在情况并将其划分为两个象限内的四种类型。随后我们评估了其对多语言性能的影响。这些代码切换类型的数据在比例上是不平衡的,并且对促进语言迁移具有不同效果。为更好地探索代码切换在预训练期间实现语言对齐的潜力,我们研究了人工合成代码切换的策略。我们不断扩大人工合成代码切换的数据规模,观察到在基准测试和表示空间方面均取得显著的改进。广泛的实验表明,纳入人工合成代码切换数据可实现更好的语言对齐,并能良好地针对预训练语料质量各异的高资源、中资源和低资源语言进行推广。

引用

@article{arxiv.2504.01801,
  title  = {Investigating and Scaling up Code-Switching for Multilingual Language Model Pre-Training},
  author = {Zhijun Wang and Jiahuan Li and Hao Zhou and Rongxiang Weng and Jingang Wang and Xin Huang and Xue Han and Junlan Feng and Chao Deng and Shujian Huang},
  journal= {arXiv preprint arXiv:2504.01801},
  year   = {2025}
}