中文

矿产还是综合?重新思考数学推理迭代对齐中的探索效率

计算与语言 2026-05-29 v3

摘要

迭代直接偏好优化(DPO)已成为大语言模型在推理任务中对齐的广泛方法。现有方法通常依赖最佳-N抽样(N8N\geq8)从分布尾部矿选正向轨迹。本文指出,在数学推理中,增加N收益递减,同时增加验证器引发的误报风险以及为策略更新所需的分布偏移。为此,我们引入PACE(通过纠正性探索实现近端对齐),这是一种基于生成的纠正框架,用低预算探索(2N32\leq N\leq3)取代穷举矿选。不通过搜索越来越稀疏的正样本,PACE通过纠正性眼见反思和验证器引导的过滤合成高保真偏好对。经验上,PACE在使用约全部分辨率的1/5计算资源的情况下,匹配或超过DPO-R1(N=16N=16)的性能,在20%标签损坏情况下仍保持鲁棒,而高N基线在此类噪声中表现 substantially更差。

关键词

引用

@article{arxiv.2602.05370,
  title  = {Mining or Synthesis? Rethinking Exploration Efficiency in Iterative Alignment of Mathematical Reasoning},
  author = {Jun Rao and Zixiong Yu and Xuebo Liu and Guhan Chen and Jing Li and Hejin Wang and Jiansheng Wei and Xiaojun Meng and Min Zhang},
  journal= {arXiv preprint arXiv:2602.05370},
  year   = {2026}
}