通过一致性增强的强化学习实现多语言推理的原生思考
计算与语言
2026-01-09 v3
摘要
大型推理模型 (LRM) 通过采用“思考-回答”范式在复杂推理任务上取得了显著性能,提升了准确率和可解释性。然而,当前的 LRM 在处理非英语语言时存在两个关键局限性:(1) 它们常常难以维持输入-输出语言的一致性;(2) 它们在错误的推理路径上表现较差,答案准确率低于英语。这些局限性显著削弱了推理过程的可解释性,降低了非英语使用者的体验,阻碍了 LRM 在全球范围内的部署。为此,我们提出了 M-Thinker,通过 GRPO 算法进行训练,其中包括语言一致性 (LC) 奖励和一种新颖的跨语言思考对齐 (CTA) 奖励。具体而言,LC 奖励对输入、思考和答案之间的语言一致性施加严格约束。此外,CTA 奖励将模型的非英语推理路径与其英语推理路径进行比较,以将其自身的推理能力从英语传递到非英语语言。通过迭代 RL 程序,我们的 M-Thinker-1.5B/4B/7B 模型不仅实现了接近 100% 的语言一致性和在两个多语言基准 (MMATH 和 PolyMath) 上的卓越性能,还在跨域语言上表现出色的泛化能力。
引用
@article{arxiv.2510.07300,
title = {Think Natively: Unlocking Multilingual Reasoning with Consistency-Enhanced Reinforcement Learning},
author = {Xue Zhang and Yunlong Liang and Fandong Meng and Songming Zhang and Kaiyu Huang and Yufeng Chen and Jinan Xu and Jie Zhou},
journal= {arXiv preprint arXiv:2510.07300},
year = {2026}
}
备注
17 pages, 14 tables, 4 figures. Code is available at: https://github.com/XZhang00/M-Thinker