中文

通过分布对齐提示合成与反向提示退火消除数学 RLVR 中的分布锐化

人工智能 2026-04-10 v1 计算与语言 机器学习

摘要

强化学习伴随可验证奖励(RLVR)可提高低 k 推理准确性,但会在具有挑战性的数学问题上缩小解答覆盖范围,pass@1 提升不一定转化为更好的大 k 性能。现有基于提示的方法可使具有挑战性的问题可训练,但未充分探讨两个问题:教师-学生分布不匹配以及降低提示暴露以匹配无提示评估的需求。我们通过两个组件来解决这些问题:分布对齐提示合成(DAHS)构造以学生风格响应为条件的经验证教师提示;反向提示退火(BHA)在难度桶之间对提示暴露进行退火,并使用 per-question hint dropout 以保持无提示更新。我们在 DAPO 训练框架下评估了该方法,针对 AIME24、AIME25 和 AIME26,使用 Qwen3-1.7B-Base\texttt{Qwen3-1.7B-Base}Llama-3.2-1B-Instruct\texttt{Llama-3.2-1B-Instruct}。在 Qwen3-1.7B-Base\texttt{Qwen3-1.7B-Base} 上,我们的方法在三个 AIME 基准测试中相对于 DAPO 提升了 pass@1 和 pass@2048。在 Llama-3.2-1B-Instruct\texttt{Llama-3.2-1B-Instruct} 上,提升集中在大 k 范围内。这些结果表明,在数学 RLVR 中,提示脚手架在训练初期有效恢复具有挑战性的问题的可训练更新,然后在无提示评估前逐渐移除。

关键词

引用

@article{arxiv.2604.07747,
  title  = {Mitigating Distribution Sharpening in Math RLVR via Distribution-Aligned Hint Synthesis and Backward Hint Annealing},
  author = {Pei-Xi Xie and Che-Yu Lin and Cheng-Lin Yang},
  journal= {arXiv preprint arXiv:2604.07747},
  year   = {2026}
}