中文

通过层次置换重新思考多语言推理差距

计算与语言 2026-05-27 v1

摘要

近期的推理大型语言模型在英文中生成链式思维(CoT),即使在非英文提示下也是如此。先前的工作表明,强制 CoT 保持在输入语言(即“本土推理”)会显著降低性能,而允许模型在英语中推理后再用输入语言回答(即“英语中心推理”)性能更好。然而,大多数关于本土推理差距的研究依赖于推理时的干预或有限的本土语言训练数据。我们在更大规模下进行了可比 supervision 的重新评估。我们构建了跨六种语言(英语、法语、德语、西班牙语、中文和斯瓠希利语)的长期多语言推理数据集;在 Qwen/Qwen3-8B-Base 上进行本土和英语中心训练的专家模型,并在数学、科学、常识和代码等任务上进行评估。在这种设置下,本土推理差距在五个非英语语言上的平均差距缩小至 1.9--3.5%,显著小于此前报告的数值。对本土专家模型的权重空间分析揭示,中间层的本土微调更新是对齐的,而外层则发生了分歧。这表明语言不可知的推理核心被语言特定的层包围。利用这一结构,我们引入了层次置换:将英语专家模型中更强的推理中间层转移到每个本土专家模型中,在保持目标语言 CoT 的前提下,基本消除了五个非英语语言上的本土推理差距。我们发布了所有模型和数据集。

关键词

引用

@article{arxiv.2605.26735,
  title  = {Rethinking the Multilingual Reasoning Gap with Layer Swap},
  author = {Maxence Lasbordes and Amélie Chatelain and Djamé Seddah},
  journal= {arXiv preprint arXiv:2605.26735},
  year   = {2026}
}