多语言预训练和指令微调改善跨语言知识对齐,但仅停留在浅层
计算与语言
2024-04-09 v1
摘要
尽管当前大语言模型在英语知识检索方面能力强大,但在不同语言上表现出不平衡的能力。为此提出了两种方法,即多语言预训练和多语言指令微调。然而,这些方法是否以及如何促进模型内部的跨语言知识对齐尚不清楚。在本文中,我们提出了CLiKA,一个系统性的框架,用于在性能、一致性和传导性三个层面评估LLM的跨语言知识对齐,并探讨了多语言预训练和指令微调对齐程度的影响。结果表明:虽然多语言预训练和指令微调都有利于跨语言知识对齐,但需要精心设计训练策略。即,持续预训练以牺牲其他语言为代价提高了目标语言的对齐,而混合预训练对其他语言的影响较小。此外,对于所有测试的LLM,整体跨语言知识对齐,尤其是在传导性层面,并不令人满意,并且多语言预训练和指令微调都无法显著改善跨语言知识传导性。
引用
@article{arxiv.2404.04659,
title = {Multilingual Pretraining and Instruction Tuning Improve Cross-Lingual Knowledge Alignment, But Only Shallowly},
author = {Changjiang Gao and Hongda Hu and Peng Hu and Jiajun Chen and Jixing Li and Shujian Huang},
journal= {arXiv preprint arXiv:2404.04659},
year = {2024}
}