LLM中面向多语言迁移的代码切换课程学习
计算与语言
2025-06-12 v2 人工智能
机器学习
摘要
大语言模型(LLM)在各种任务上已表现出接近人类水平的性能,但由于预训练数据的不平衡,其在少数几种高资源语言之后的性能会急剧下降。借鉴人类第二语言习得的过程,特别是代码切换——对话中的语言交替实践——我们提出了代码切换课程学习(CSCL)以增强LLM的跨语言迁移能力。CSCL通过课程学习模拟人类语言学习的阶段,包括1) token级代码切换、2) 句子级代码切换和3) 单语语料库。我们以Qwen 2作为基础模型,证明了CSCL在改善向韩语的跨语言迁移方面的有效性,与单语持续预训练方法相比取得了显著的性能提升。消融研究表明,token级和句子级代码切换都显著增强了跨语言迁移,而课程学习放大了这些效果。我们还将研究结果扩展到各种语言,包括日语(高资源)和印尼语(低资源),并使用另外两个模型(Gemma 2和Phi 3.5)。我们进一步表明,CSCL减轻了语言资源与安全对齐之间的虚假相关性,为更公平的语言迁移提供了一个稳健、高效的框架。我们观察到CSCL在低资源设置下同样有效,在这些设置中高质量的单语语料库难以获得。
引用
@article{arxiv.2411.02460,
title = {Code-Switching Curriculum Learning for Multilingual Transfer in LLMs},
author = {Haneul Yoo and Cheonbok Park and Sangdoo Yun and Alice Oh and Hwaran Lee},
journal= {arXiv preprint arXiv:2411.02460},
year = {2025}
}
备注
To appear in Findings of ACL 2025