大规模推理模型在跨脚本参数知识迁移方面的困境
计算与语言
2026-03-19 v1 人工智能
摘要
本文分析了大型现代推理类大语言模型在跨语言知识迁移方面的不足之处。我们展示了感知到的知识迁移差距主要是脚本障碍。首先,我们对思考型模型在两个来自世界各地本地知识数据集(ECLeKTic 和 MultiLoKo)上的表现进行观察性数据分析。我们的回归分析表明,脚本匹配——而非语言或语族——是知识迁移失败的主要预测因子,在模型能力和问题难度被控制后。我们进一步通过为 LLMs 提供问题关键实体的源语言版本,发现这在跨脚本问题上效果显著提升。随后,我们认为这些 LLMs 在测试时可能更擅长推理。为评估这一假设,我们开发了一个合成生成管道,设计 SFT 样本以鼓励模型在推理时更好地处理音译歧义,从而在推理时获取参数知识。我们表明,教会两个模型更好的推理能力可缩小跨脚本迁移差距。因此,我们得出结论,在后训练期间可以改进跨语言参数知识迁移。
引用
@article{arxiv.2603.17070,
title = {Large Reasoning Models Struggle to Transfer Parametric Knowledge Across Scripts},
author = {Lucas Bandarkar and Alan Ansell and Trevor Cohn},
journal= {arXiv preprint arXiv:2603.17070},
year = {2026}
}