LiveCLKTBench:面向多语言 LLM 跨语言知识迁移可靠评估
计算与语言
2026-04-21 v4 人工智能
摘要
评估大语言模型中的跨语言知识迁移具有挑战性,因为目标语言中的正确答案可能源于真正的迁移,或源于在预训练期间的先验暴露。我们提出LiveCLKTBench,一个专为隔离和衡量跨语言知识迁移而设计的自动化生成管道。我们的管道从真实世界领域中识别自包含、时序敏感的知识实体,依据时序出现情况进行筛选,并通过模型的知识进行验证。这些有效实体的文档随后用于生成事实性问题,并翻译成多种语言,以评估跨语言边界的可移植性。在LiveCLKTBench的基础上,我们评估了多个 LLM 在五种语言中的表现,发现跨语言迁移受语言距离强烈影响,往往在语言方向上呈现非对称性。虽然更大的模型改进了迁移,但规模的提升效应会随规模而减弱,并在不同领域中有所不同。这些发现为多语言迁移提供了新见解,并证明了LiveCLKTBench作为可靠基准对未来研究具有重要价值。
引用
@article{arxiv.2511.14774,
title = {LiveCLKTBench: Towards Reliable Evaluation of Cross-Lingual Knowledge Transfer in Multilingual LLMs},
author = {Pei-Fu Guo and Yun-Da Tsai and Chun-Chia Hsu and Kai-Xin Chen and Ya-An Tsai and Kai-Wei Chang and Nanyun Peng and Mi-Yen Yeh and Shou-De Lin},
journal= {arXiv preprint arXiv:2511.14774},
year = {2026}
}