中文

通过模型合并适配混合代码任务的多语言模型

计算与语言 2025-10-24 v2

摘要

我们研究了模型合并作为面向代码混合NLP任务的常规适应策略。从多语言基础模型开始,我们:(i)在无标签混合代码文本上进行继续预训练(CPT)以获得适应后的检查点,(ii)将检查点与基础模型合并,(iii)在下游任务数据上进行微调(FT)。我们使用XLM-R和Llama-3.2-1B模型评估了该方法,用于英-印地语(En-Hi)和英-西班牙语(En-Es)的句子分类任务(情感分析和仇恨言论)。结果表明,合并模型在全微调和CPT->FT方面表现一致优于。我们观察到合并模型相对于全微调提升了2--5分F1分,相对于CPT->FT提升约1-2分,表明通过合并更有效地利用了无标签数据。大型LLM(如Llama-3.3-70B)的零/少样提示生成性能落后于微调和合并检查点,凸显了面向代码混合输入的注意力学习的局限性。我们进一步测试了跨对转移,即在En-Hi上训练,在En-Ta和En-Ml上评估:合并检查点在于单诊英基准(如TV/TIES变体达到0.65-0.68 F1分)强于全微调(0.61-0.63 F1分),表明代码混合知识是面向低资源对的更可靠基石。我们以适配常见数据情形(仅标注;标注+无标签;仅转移)提供了适应配方,并讨论了更广泛任务和更大模型的局限性与扩展考虑。

关键词

引用

@article{arxiv.2510.19782,
  title  = {Adapting Multilingual Models to Code-Mixed Tasks via Model Merging},
  author = {Prashant Kodali and Vaishnavi Shivkumar and Swarang Joshi and Monojit Choudhary and Ponnurangam Kumaraguru and Manish Shrivastava},
  journal= {arXiv preprint arXiv:2510.19782},
  year   = {2025}
}

备注

9 pages, 5 tables, CODS 2025