ADHint:基于难度先验的自适应提示用于强化学习
计算机视觉与模式识别
2026-03-11 v2 机器学习
摘要
为解决强化学习 (RL) 的能力扩展受限和样本效率低的问题,最近的方法将“提示”集成到后训练中,这些提示是完整推理轨迹的前缀片段,旨在实现强大的知识扩展和推理泛化。然而,现有的基于提示的 RL 方法常常忽视提示比例计划和相对优势估计中的难度作用,导致学习不稳定并过度模仿来自 off-policy 提示。为解决这一问题,我们提出了 ADHint,通过显式整合难度来实现探索与模仿之间的更好平衡。具体而言,我们提出了基于样本难度先验的自适应提示 (Adaptive Hint with Sample Difficulty Prior),用于评估当前策略下每个样本的难度,以为滚动生成安排合适的提示比例。此外,我们引入了基于一致性的梯度调制 (Consistency-based Gradient Modulation) 以及针对提示保留的选择性遮蔽 (Selective Masking for Hint Preservation),共同调制提示中 token 级别的梯度,以防止偏置和破坏性更新。我们还提出了基于滚动轨迹难度后验的优势估计 (Advantage Estimation with Rollout Difficulty Posterior),利用带无提示和有提示滚动轨迹之间的相对难度来计算其各自优势,从而实现更平衡的更新。在多样化的模态、模型规模、模型家族和领域上的大量实验表明,ADHint 在推理能力和跨域泛化方面取得优异性能。代码和数据集将在论文接受后公开。
引用
@article{arxiv.2512.13095,
title = {ADHint: Adaptive Hints with Difficulty Priors for Reinforcement Learning},
author = {Feng Zhang and Zezhong Tan and Xinhong Ma and Ziqiang Dong and Xi Leng and Jianfei Zhao and Xin Sun and Yang Yang},
journal= {arXiv preprint arXiv:2512.13095},
year = {2026}
}