中文

CoCo-CoLa:评估与改进多语言LLM的语言遵循性

表示论 2025-02-19 v1 微分几何

摘要

多语言大型语言模型(LLM)尽管在有限的平行数据上进行训练,却发展出跨语言能力。然而,它们常常难以生成预期语言的响应,偏好高资源语言如英语。在本工作中,我们引入CoCo-CoLa(Correct Concept - Correct Language),一种用于评估多语言LLM语言遵循性的新指标。通过在七种语言上进行的闭卷问答任务的微调实验,我们分析了单一语言的训练如何影响其他语言的性能。我们的发现表明,多语言模型在跨语言间共享任务知识,但在输出语言选择上表现出偏见。我们识别出语言特定的层,表明最终层在决定输出语言方面起关键作用。因此,我们提出一种部分训练策略,通过选择性微调关键层来提高语言遵循性,同时显著降低计算成本。该方法在低资源语言方面实现了与完整微调相当或更好的性能,提供了更高效的多语言适应方案。

关键词

引用

@article{arxiv.2502.12475,
  title  = {On the variety of Lie algebras endowed with complex structures: degenerations and deformations},
  author = {Edison Alberto Fernández-Culma and Nadina Rojas},
  journal= {arXiv preprint arXiv:2502.12475},
  year   = {2025}
}

备注

All comments or suggestions are most welcome. 20 Pages + appendix