大规模推理模型并非多语言潜在推理者
计算与语言
2026-04-20 v2
摘要
大规模推理模型(LRMs)在数学推理任务中取得了强大的性能,往往归因于其生成显式链式思考(CoT)解释的能力。然而,近期研究表明,LRMs 常常在完成这些文字推理步骤之前就已得出正确答案,这表明存在潜在推理——即编码于隐藏状态中的非语言内部计算。尽管这一现象在英语语境下已有探讨,但其多语言行为仍鲜有了解。本文系统性地调查了 LRMs 在 11 种语言中的多语言潜在推理。我们采用基于截断的策略,检验正确答案在模型仅给定部分推理痕迹的情况下如何逐步出现,从而衡量潜在预测形成的时间序列。我们的结果揭示了明确的多语言潜在推理证据,尽管呈现不均:在资源丰富的语言中表现强劲,在低资源语言中表现较弱,难度更高的基准测试中也难以观察到。这一差异是否反映出不同的内部机制?我们进一步进行了表征分析。尽管在表面上存在差异,我们发现预测的内部演化在不同语言之间高度一致,且广泛地与英语一致——这一模式暗示了以英语为中心的潜在推理路径。
引用
@article{arxiv.2601.02996,
title = {Large Reasoning Models Are (Not Yet) Multilingual Latent Reasoners},
author = {Yihong Liu and Raoyuan Zhao and Hinrich Schütze and Michael A. Hedderich},
journal= {arXiv preprint arXiv:2601.02996},
year = {2026}
}
备注
ACL 2026 Findings