矿产还是综合?重新思考数学推理迭代对齐中的探索效率
计算与语言
2026-05-29 v3
摘要
迭代直接偏好优化(DPO)已成为大语言模型在推理任务中对齐的广泛方法。现有方法通常依赖最佳-N抽样()从分布尾部矿选正向轨迹。本文指出,在数学推理中,增加N收益递减,同时增加验证器引发的误报风险以及为策略更新所需的分布偏移。为此,我们引入PACE(通过纠正性探索实现近端对齐),这是一种基于生成的纠正框架,用低预算探索()取代穷举矿选。不通过搜索越来越稀疏的正样本,PACE通过纠正性眼见反思和验证器引导的过滤合成高保真偏好对。经验上,PACE在使用约全部分辨率的1/5计算资源的情况下,匹配或超过DPO-R1()的性能,在20%标签损坏情况下仍保持鲁棒,而高N基线在此类噪声中表现 substantially更差。
引用
@article{arxiv.2602.05370,
title = {Mining or Synthesis? Rethinking Exploration Efficiency in Iterative Alignment of Mathematical Reasoning},
author = {Jun Rao and Zixiong Yu and Xuebo Liu and Guhan Chen and Jing Li and Hejin Wang and Jiansheng Wei and Xiaojun Meng and Min Zhang},
journal= {arXiv preprint arXiv:2602.05370},
year = {2026}
}