将语言视为推理优化的潜在变量
计算与语言
2026-05-05 v2
摘要
随着 LLM 对英语中心偏见的减弱,出现了一个意想不到的趋势:非英语响应在推理任务上时常优于英语。我们假设语言作为潜在变量,从结构上调制模型的内部推理路径,而不仅仅是作为输出媒介。为此,我们进行了 Polyglot Thinking 实验,在语言受限和语言不受约束条件下,让模型解决相同的题目。结果表明,非英语响应通常实现更高的准确率,而最佳性能往往发生在语言不受约束的情况下,这表明多语言性拓宽了模型的潜在推理空间。基于这一洞见,我们提出了 polyGRPO(Polyglot Group Relative Policy Optimization),一种将语言变化视为隐式探索信号的 RL 框架。它在语言受限和不受约束条件下在线生成多语言偏好数据,针对答案准确率和推理结构进行策略优化。仅凭 18.1K 多语言数学问题(无链式思维标注)训练,polyGRPO 将基础模型(Qwen2.5-7B-Instruct)在四个英语推理测试集上的绝对准确率提升 6.72%,在其多语言基准测试中提升 6.89%。值得注意的是,尽管仅在数学数据上训练,polyGRPO 仍是唯一在英语常识推理任务(提升 4.9%)中超越基础 LLM的方法,这凸显了其强大的跨任务泛化能力。进一步的分析显示,将语言视为潜在变量可拓展模型的潜在推理空间,从而在推理性能方面实现一致且可泛化的改进。
引用
@article{arxiv.2604.21593,
title = {Language as a Latent Variable for Reasoning Optimization},
author = {Linjuan Wu and Haoran Wei and Jialong Tang and Shuang Luo and Baosong Yang and Yongliang Shen and Weiming Lu},
journal= {arXiv preprint arXiv:2604.21593},
year = {2026}
}
备注
17 pages, 7 figures, Under Reviewing