推动超越舒适区:面向 RLVR 的高效策略引导探索
人工智能
2026-05-18 v1 计算与语言
摘要
基于可验证奖励的强化学习(RLVR)已成为提升大语言模型推理能力的可扩展范式。然而,其有效性从根本上受到探索的限制:策略只能在其已采样的轨迹上进行改进。虽然增加 rollout 数量可以缓解此问题,但这种暴力扩展计算成本高昂,并且现有修改优化目标的方法对探索内容的控制有限。在这项工作中,我们提出了 NudgeRL,一个用于 RLVR 中结构化和多样性驱动探索的框架。我们的方法引入了策略推动(Strategy Nudging),它通过轻量级的策略级上下文来条件化每个 rollout,以诱导多样化的推理轨迹,而无需依赖昂贵的 oracle 监督。为了有效地从这种结构化探索中学习,我们进一步提出了一个统一的目标,该目标将奖励信号分解为上下文间和上下文内分量,并引入了一个蒸馏目标,将发现的行为迁移回基础策略。实验证明,NudgeRL 优于标准 GRPO,其 rollout 预算高达 8 倍,同时在五个具有挑战性的数学基准测试中,平均性能优于基于 oracle 引导的 RL 基线。这些结果表明,结构化的、上下文驱动的探索可以作为暴力 rollout 扩展和基于特权信息的可行性导向方法的有效且可扩展的替代方案。我们的代码可在 https://github.com/tally0818/NudgeRL 获取。
引用
@article{arxiv.2605.15726,
title = {Nudging Beyond the Comfort Zone: Efficient Strategy-Guided Exploration for RLVR},
author = {Chanuk Lee and Sangwoo Park and Minki Kang and Sung Ju Hwang},
journal= {arXiv preprint arXiv:2605.15726},
year = {2026}
}
备注
28 pages, 7 figures