中文

SHARP:面向大规模推理模型强化学习的高质量对齐推理问题合成方法

人工智能 2025-05-27 v3

摘要

在 STEM 领域使用强化学习训练大规模推理模型(LRM)受限于高质量、多样且可验证问题集合的稀缺。现有合成方法,如链式思维(Chain-of-Thought)提示词,常生成过于简化或不可检查的数据,限制了模型在复杂任务上的发展。为解决这些挑战,我们提出了 SHARP(Synthesizing High-quality Aligned Reasoning Problems for LRMs reinforcement learning with verifiable rewards, RLVR),一种统一的、用于 LRM 强化学习的高质量对齐推理问题合成方法,其可验证奖励(RLVR)确保问题的严谨性。SHARP 包含一套自对齐原则:针对研究生级和奥林匹克级难度、严格的逻辑一致性以及无歧义、可验证的答案,并包含一个结构化的三阶段框架(对齐、实例化、推理),确保主题多样性和对问题生成的细粒度控制。我们通过利用最先进的 LRM 来推断和验证具有挑战性的 STEM 问题,然后采用强化学习循环,通过可验证的奖励信号不断 refinement 模型的推理能力。在 GPQA 等基准测试上实验表明,SHARP 增强的训练在现有方法上显著超越,显著提高了复杂推理准确率,将 LRM 性能推向专家水平。我们的贡献包括 SHARP 策略、框架设计、端到端实现以及实验评估,其在提升 LRM 推理能力方面效果显著。

关键词

引用

@article{arxiv.2505.14147,
  title  = {SHARP: Synthesizing High-quality Aligned Reasoning Problems for Large Reasoning Models Reinforcement Learning},
  author = {Xiong Jun Wu and Zhenduo Zhang and ZuJie Wen and Zhiqiang Zhang and Wang Ren and Lei Shi and Cai Chen and Deng Zhao and Qing Wang and Xudong Han and Chengfu Tang and Dingnan Jin and Qing Cui and Jun Zhou},
  journal= {arXiv preprint arXiv:2505.14147},
  year   = {2025}
}