少量学习:测量 RLVR 在低数据和计算环境下的效果
人工智能
2026-04-21 v1 机器学习
摘要
微调大型语言模型 (LLM) 通常依赖大量高质量标注数据,或在强化学习可验证奖励 (RLVR) 的情况下依赖具有明确正确答案的问题。虽然先前的工作探索了通过扩大用于 RLVR 的数据和计算量来提升模型推理能力的好处,但这些结果在标注数据稀缺或可获取计算资源有限的实际场景中缺乏适用性。在本文中,我们进行了一项全面的经验研究,评估在低数据环境下使用 RLVR 对开源小型语言模型 (SLM) 性能的影响。我们跨越三个新型数据集进行研究,涵盖数数计数问题、图形推理和空间推理,刻画模型性能随数据集大小、多样性和复杂度的变化规律。我们证明:(1) 程序化数据集允许进行精细的评估和训练数据集开发,具备可控的属性(大小、多样性和复杂度);(2) 在 RLVR 下,训练于较低复杂度任务的模型可推广到更高复杂度的任务;(3) 在混合复杂度数据集上训练与在低数据环境下使用单一简单任务训练相比,能提供最高可达 5 倍的样本效率。这些发现为未来在 RLVR 上发展数据扩展规律以及利用程序化数据生成器进一步理解高效 LLM 微调的有效数据开发提供了灵感。
引用
@article{arxiv.2604.18381,
title = {Learning from Less: Measuring the Effectiveness of RLVR in Low Data and Compute Regimes},
author = {Justin Bauer and Thomas Walshe and Derek Pham and Harit Vishwakarma and Armin Parchami and Frederic Sala and Paroma Varma},
journal= {arXiv preprint arXiv:2604.18381},
year = {2026}
}