Miner:为大型推理模型的数据高效强化学习挖掘内在精通度
人工智能
2026-05-11 v2 计算与语言
摘要
当前针对大型推理模型的无 critic 的强化学习方法在正同质提示(即所有 rollout 均正确)上训练时存在严重的低效性,由于零优势估计导致 rollout 的浪费。我们引入了一种极其简单却强大的解决方案来挖掘内在精通度,该方法将策略的内在不确定性重新用作自监督奖励信号,无需外部监督、辅助模型或额外推理成本。我们的方法开创了两项关键创新:(1) token 级别的焦点信用分配机制,该机制动态放大关键不确定 token 的梯度,同时抑制过度自信的 token;(2) 自适应优势校准,以无缝整合内在奖励与可验证奖励。在 Qwen3-4B 和 Qwen3-8B 基础模型上的六个推理基准中进行了评估,Miner 在其他四种算法中取得了 SOTA 性能,与 GRPO 相比,在 Pass@1 上获得了高达 4.58 的绝对增益,在 Pass@K 上获得了 6.66 的增益。与其他针对探索增强的方法的比较进一步揭示了这两项新提出创新的优越性。这表明,潜在不确定性利用对于推理模型的高效且可扩展的强化学习训练既是必要的也是充分的。代码可在 https://github.com/pixas/Miner 获取。
引用
@article{arxiv.2601.04731,
title = {Miner:Mining Intrinsic Mastery for Data-Efficient RL in Large Reasoning Models},
author = {Shuyang Jiang and Yuhao Wang and Ya Zhang and Yanfeng Wang and Yu Wang},
journal= {arXiv preprint arXiv:2601.04731},
year = {2026}
}
备注
24 pages