从试错到改进:RLVR中LLM探索机制的系统性分析
计算与语言
2025-08-19 v2
摘要
基于可验证奖励的强化学习(RLVR)已成为增强大型语言模型(LLM)推理能力的一种强大范式。与传统的强化学习方法不同,RLVR利用基于规则的反馈来引导LLM生成和优化复杂的推理链——这一过程严重依赖于有效的探索策略。尽管先前的工作已经证明了RLVR的实证成功,但支配LLM探索行为的基本机制仍未得到充分探索。本技术报告对RLVR中的探索能力进行了系统性研究,涵盖四个主要方面:(1)探索空间塑造,我们开发了定量指标来刻画LLM的能力边界;(2)熵与性能的权衡,从训练阶段、单个实例和词元级别模式三个层面进行分析;(3)强化学习性能优化,考察将探索增益有效转化为可衡量改进的方法。通过将先前已识别的见解与新的实证证据相结合,本工作旨在为推进RLVR系统提供一个基础性框架。
引用
@article{arxiv.2508.07534,
title = {From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR},
author = {Jia Deng and Jie Chen and Zhipeng Chen and Daixuan Cheng and Fei Bai and Beichen Zhang and Yinqian Min and Yanzipeng Gao and Wayne Xin Zhao and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2508.07534},
year = {2025}
}
备注
27pages,25figures. arXiv admin note: text overlap with arXiv:2508.02260