RLVR中LLM推理的语义空间探索与利用
机器学习
2026-04-21 v5 计算与语言
摘要
用于LLM推理的基于可验证奖励的强化学习(RLVR)通常被表述为在动作空间中平衡探索与利用,通常通过基于token的代理(如输出熵或置信度)来实现。我们认为,这种表面上的权衡在很大程度上是一种测量伪影:token级统计量反映的是下一个token的不确定性,而非推理如何在多token语义结构上推进。因此,我们研究了响应轨迹的隐藏状态空间中的探索与利用。我们使用有效秩(ER)来量化表征探索,并引入其时间导数——有效秩速度(ERV)和有效秩加速度(ERA)——来刻画利用性细化动力学。实证和理论分析均表明,ER和ERV在语义空间中呈现近零相关性,表明这两种能力可以同时提升。受此启发,我们提出了速度利用秩学习(VERL),它通过来自ER/ERV的辅助信号塑造RLVR优势,并使用更稳定的ERA作为元控制变量来自适应地平衡激励。在多个基础模型、RLVR算法和推理基准上的实验表明,VERL持续带来改进,在具有挑战性的任务上取得了显著提升(例如高考2024年任务上提升了21.4%)。代码位于 https://github.com/hf618/VERL。
引用
@article{arxiv.2509.23808,
title = {Semantic-Space Exploration and Exploitation in RLVR for LLM Reasoning},
author = {Fanding Huang and Guanbo Huang and Xiao Fan and Yi He and Xiao Liang and Xiao Chen and Qinting Jiang and Faisal Nadeem Khan and Jingyan Jiang and Zhi Wang},
journal= {arXiv preprint arXiv:2509.23808},
year = {2026}
}
备注
Accepted as an ACL 2026 Findings paper