DIVER:面向通用推理的多样性激励探索框架
人工智能
2026-02-24 v2
摘要
基于可验证奖励的强化学习(RLVR)已成为激励大语言模型(LLM)推理能力的关键范式。由于推理任务中巨大的状态-动作空间和奖励稀疏性,现有方法常常面临探索不足和样本效率低下的问题。在本文中,我们提出DIVER(面向通用推理的多样性激励探索),这是一个创新框架,强调了全局序列级多样性在激励深度探索以实现通用推理中的关键作用。我们首先进行了一项初步的实证研究,揭示了全局多样性与推理能力之间存在强正相关关系。基于这一洞察,我们引入全局多样性激励作为内在奖励,以促进在语义结构化空间中的深度探索。结合内在奖励,我们开发了一种基于势能的奖励塑形机制以保持最优策略不变性,并设计了简单的启发式方法来缓解可能的奖励黑客行为。实验结果表明,DIVER在域内和域外任务上均优于采用各种探索策略的竞争性RLVR基线,在Pass@1和Pass@k评估中均表现出色。我们的代码可在https://github.com/NJU-RL/DIVER获取。
引用
@article{arxiv.2509.26209,
title = {Diversity-Incentivized Exploration for Versatile Reasoning},
author = {Zican Hu and Shilin Zhang and Yafu Li and Jianhao Yan and Xuyang Hu and Leyang Cui and Xiaoye Qu and Chunlin Chen and Yu Cheng and Zhi Wang},
journal= {arXiv preprint arXiv:2509.26209},
year = {2026}
}
备注
26 pages, 10 figures