CDE:基于好奇心驱动的强化学习在大语言模型中的高效探索
计算与语言
2025-09-12 v1 人工智能
机器学习
摘要
基于可验证奖励的强化学习 (RLVR) 是增强大型语言模型 (LLM) 推理能力的强大范式。然而,当前的 RLVR 方法往往探索不佳,导致早期收敛和熵崩溃。为此,我们引入好奇心驱动探索 (CDE),一个利用模型自身内在好奇心指引探索的框架。我们用演员和评论家两方的信号形式化化好奇心:对于演员,我们使用其生成响应的困惑度;对于评论家,我们使用来自多头架构的价值估计方差。这两个信号作为探索奖励嵌入 RLVR 框架,以指引模型。我们的理论分析表明,演员级奖励本质上会惩罚过度自信的错误,促进正确响应之间的多样性;此外,我们将评论家级奖励与 RL 中 established 的基于计数的探索奖励相联系。经验上,我们的方法在 AIME 基准上相较于标准 RLVR 使用 GRPO/PPO 获得约 3 分的提升。进一步分析识别了 RLVR 中的一种校准崩溃机制,揭示了常见的 LLM 故障模式。
引用
@article{arxiv.2509.09675,
title = {CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models},
author = {Runpeng Dai and Linfeng Song and Haolin Liu and Zhenwen Liang and Dian Yu and Haitao Mi and Zhaopeng Tu and Rui Liu and Tong Zheng and Hongtu Zhu and Dong Yu},
journal= {arXiv preprint arXiv:2509.09675},
year = {2025}
}
备注
21 pages