推理路径分歧:解锁大语言模型多样化思维的新度量与策展策略
计算与语言
2026-01-06 v2
摘要
尽管测试时扩展已被证明能有效提升大语言模型的推理能力,但模型输出的低多样性常常成为瓶颈;这在一定程度上是由常见的“一题一解”训练实践造成的,该实践提供单一规范答案,可能将模型推向狭窄的推理路径集合。这种同质化不仅限制了采样效率,也限制了后续强化学习阶段的探索空间。为解决此问题,我们提出“一题多解”训练范式,使模型接触各种有效的推理轨迹,从而增加推理多样性。一题多解的一个核心挑战是可靠地衡量多步思维链之间的语义差异,因此我们引入了推理路径分歧,这是一种步骤级度量,用于对齐和评分长思维链解决方案,以捕捉中间推理中的差异。利用推理路径分歧,我们为每个问题策展出多样性最大的解集,并对Qwen3-4B-Base进行微调。实验表明,基于推理路径分歧选择的训练能产生更多样化的输出和更高的pass@k,在pass@16上相较于强一题一解基线平均提升+2.80%,在AIME24上提升+4.99%,证明一题多解进一步放大了测试时扩展的有效性。我们的代码可在https://github.com/fengjujf/Reasoning-Path-Divergence获取。
引用
@article{arxiv.2510.26122,
title = {Reasoning Path Divergence: A New Metric and Curation Strategy to Unlock LLM Diverse Thinking},
author = {Feng Ju and Zeyu Qin and Rui Min and Zhitao He and Lingpeng Kong and Yi R. Fung},
journal= {arXiv preprint arXiv:2510.26122},
year = {2026}
}