通过随机选择的少样本引导提升基于可验证奖励的强化学习
机器学习
2026-05-15 v1 人工智能
计算与语言
摘要
基于可验证奖励的强化学习(RLVR)在开发具有链路思维rollout的大型语言模型(LLM)方面取得了很大成功,用于许多任务,如数学和编码。然而,RLVR在困难问题上样本效率方面存在挑战,其中正确的rollout难以生成。先前的工作提出通过演示引导的RLVR来解决此问题,即在RL失败时进行监督微调(SFT);然而,SFT通常需要大量数据,这些数据获取可能昂贵。在本文中,我们提出了FEW-ShOT演示引导RLVR算法(FEST)。它仅使用从SFT数据集中随机选择的128个演示即可取得令人瞩目的成果。我们发现三个组件对成功至关重要:监督信号、on-policy信号以及对少样本SFT数据集的衰减权重,以防止多轮训练导致的过拟合。在多个基准测试上,FEST在需要的数据量远小于SFT数据的情况下超过基线,即使在使用完整数据集时也能匹配其性能。
引用
@article{arxiv.2605.15012,
title = {Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance},
author = {Kai Yan and Alexander G. Schwing and Yu-Xiong Wang},
journal= {arXiv preprint arXiv:2605.15012},
year = {2026}
}
备注
25 pages, 11 figures