A2R:面向平行推理的非对称两阶段推理框架
人工智能
2025-09-29 v1 计算与语言
摘要
近期的大型推理模型通过在推理阶段分配更多计算资源(“延长思考”范式)实现了在复杂任务解决方面的显著提升。尽管基础推理能力快速发展,但模型在单次尝试与其潜在能力之间存在显著差距——后者往往仅在跨多个解决方案路径中才会显现。这突显了模型在实现能力与固有能力之间的鹬指鸟兽。为此,我们提出A2R(Asymmetric Two-Stage Reasoning),一个旨在显式弥合模型潜能与实际表现之间差距的非对称两阶段推理框架。在此框架中,“探索者”模型通过重复抽样并行生成潜在解决方案,随后,“合成者”模型整合这些参考方案以进行更精细的第二阶段推理。这种两阶段过程允许计算规模与现有顺序方法正交扩展。我们的工作作出两项关键创新:首先,我们将A2R作为即插即用的平行推理框架,显著提升模型在复杂问题上的能力。例如,使用我们的框架,Qwen3-8B-distill模型相较于自信一致基线实现了75%的性能提升。其次,通过系统分析探索者与合成者的角色,我们识别出一种有效的非对称规模化范式,这一洞见导致A2R-Efficient,即一种将Qwen3-4B探索者与Qwen3-8B合成者组合的“小到大”变体。该配置在几乎30%更低的成本下超越了单一Qwen3-32B模型的平均性能。总体而言,这些结果表明A2R不仅是一种性能提升框架,更是一种高效且实用的实际应用解决方案。
引用
@article{arxiv.2509.22044,
title = {A2R: An Asymmetric Two-Stage Reasoning Framework for Parallel Reasoning},
author = {Ziqi Wang and Boye Niu and Zhongli Li and Linghui Meng and Jing Liu and Zhi Zheng and Tong Xu and Hua Wu and Haifeng Wang and Enhong Chen},
journal= {arXiv preprint arXiv:2509.22044},
year = {2025}
}
备注
15 pages, 3 figures