中文

HINT:帮助低效回放走向高效

机器学习 2025-10-13 v1 计算与语言

摘要

强化学习(RL)已成为增强大型语言模型(LLM)长链式思维推理能力的关键驱动力。然而,像GRPO这样的主流方法在任务难度超出模型能力时常常失效,导致奖励稀疏和训练低效。虽然先前工作尝试通过使用离线数据来缓解此问题,例如将RL与监督微调(SFT)混合或使用提示,但它们常常误导策略更新。在这项工作中,我们识别出这些失败的根本原因,我们称之为低训练亲和度。这种条件源于外部指导与模型策略之间的巨大分布不匹配。为了诊断这一问题,我们引入了亲和度——第一个用于监控探索效率和训练稳定性的定量指标。为了提高亲和度,我们提出了HINT:帮助低效回放走向高效,一种自适应提示框架。HINT不提供直接答案,而是提供启发式提示来引导模型自主发现解决方案,从而保留其自主推理能力。在数学推理任务上的大量实验表明,HINT持续优于现有方法,在各种规模的模型上取得了最先进的结果,同时展示了显著更稳定的学习和更高的数据效率。代码在GitHub上公开。

关键词

引用

@article{arxiv.2510.09388,
  title  = {HINT: Helping Ineffective Rollouts Navigate Towards Effectiveness},
  author = {Xinyi Wang and Jinyi Han and Zishang Jiang and Tingyun Li and Jiaqing Liang and Sihang Jiang and Zhaoqian Dai and Shuguang Ma and Fei Yu and Yanghua Xiao},
  journal= {arXiv preprint arXiv:2510.09388},
  year   = {2025}
}