通过分布对齐提示合成与反向提示退火消除数学 RLVR 中的分布锐化
人工智能
2026-04-10 v1 计算与语言
机器学习
摘要
强化学习伴随可验证奖励(RLVR)可提高低 k 推理准确性,但会在具有挑战性的数学问题上缩小解答覆盖范围,pass@1 提升不一定转化为更好的大 k 性能。现有基于提示的方法可使具有挑战性的问题可训练,但未充分探讨两个问题:教师-学生分布不匹配以及降低提示暴露以匹配无提示评估的需求。我们通过两个组件来解决这些问题:分布对齐提示合成(DAHS)构造以学生风格响应为条件的经验证教师提示;反向提示退火(BHA)在难度桶之间对提示暴露进行退火,并使用 per-question hint dropout 以保持无提示更新。我们在 DAPO 训练框架下评估了该方法,针对 AIME24、AIME25 和 AIME26,使用 和 。在 上,我们的方法在三个 AIME 基准测试中相对于 DAPO 提升了 pass@1 和 pass@2048。在 上,提升集中在大 k 范围内。这些结果表明,在数学 RLVR 中,提示脚手架在训练初期有效恢复具有挑战性的问题的可训练更新,然后在无提示评估前逐渐移除。
引用
@article{arxiv.2604.07747,
title = {Mitigating Distribution Sharpening in Math RLVR via Distribution-Aligned Hint Synthesis and Backward Hint Annealing},
author = {Pei-Xi Xie and Che-Yu Lin and Cheng-Lin Yang},
journal= {arXiv preprint arXiv:2604.07747},
year = {2026}
}