中文

跨语言的长思维链推理

计算与语言 2026-03-24 v3 人工智能 机器学习

摘要

尽管大型推理模型在用英语生成长思维链方面展现了卓越能力,我们仍然缺乏对这些长篇推理能力如何迁移到世界上绝大多数语言的理解。在本工作中,我们系统地研究了模型开发的四个关键阶段——扩展、预训练、后训练和推理——以理解长 CoT 能力如何扩展到英语之外。我们在九种非英语目标语言中比较了两种推理设置:En-CoT,即模型处理目标语言输入,但用英语推理;以及 Target-CoT,即模型在目标语言中处理输入并生成长 CoT。我们发现,扩大推理模型规模提升了 En-CoT 中的多语言任务表现,但 Target-CoT 的表现滞后。对于需要长篇、多步 CoT 的任务(如数学推理),这一差距进一步扩大。转向预训练,我们发现添加专门的推理阶段提升了 En-CoT 表现但降低了 Target-CoT 表现,而广泛的多语言预训练则同时提升了两种模式。鉴于英语以外语言中高质量推理轨迹的稀缺性,我们探索了用于后训练的合成数据构建方法。我们证明,对从黄金英语轨迹自动翻译的推理轨迹进行微调,其效果优于对从大型推理模型蒸馏得到的目标语言轨迹进行微调。最后,我们报告了不同语言之间推理效率的差异,并揭示了 CoT 中特定语言的失败模式。我们发布了模型、数据集和代码以促进进一步研究。

关键词

引用

@article{arxiv.2508.14828,
  title  = {Long Chain-of-Thought Reasoning Across Languages},
  author = {Josh Barua and Seun Eisape and Kayo Yin and Alane Suhr},
  journal= {arXiv preprint arXiv:2508.14828},
  year   = {2026}
}

备注

Accepted to ICLR 2026. v1 is a workshop version accepted to SCALR @ COLM 2025