计数计数:基于计数型内在奖励激发大语言模型推理中的探索
人工智能
2025-10-24 v2
摘要
强化学习 (RL) 已成为增强大型语言模型 (LLMs) 多步推理能力的引人注目的 방법之一。然而,现存的 RL 方法仍依赖稀疏的基于结果的奖励和有限的探索,常导致 LLMs 采取重复且次优的推理模式。本文研究了如何为 LLM 推理设计探索的核心问题,引入 MERCI (基于计数型内在奖励激发 LLM 推理中的探索),这是一种新的 RL 算法,通过原则化的内在奖励来增强策略优化。基于计数探索思想,MERCI 利用轻量级硬币翻转网络 (CFN) 估计伪计数和推理轨迹的认知不确定性,并将其转化为内在奖励,以价值新颖性同时保留任务奖励的学习信号。我们将 MERCI 集成到诸如群体相对策略优化 (GRPO) 等先进的 RL 框架中。实验在复杂推理基准测试上表明,MERCI 鼓励更丰富、更具多样性的思考链,显著优于强基线,帮助策略摆脱局部常规,发现更好的解决方案。这表明我们的针对性内在动机可使语言模型推理中的探索变得可靠。
引用
@article{arxiv.2510.16614,
title = {Count Counts: Motivating Exploration in LLM Reasoning with Count-based Intrinsic Rewards},
author = {Xuan Zhang and Ruixiao Li and Zhijian Zhou and Long Li and Yulei Qin and Ke Li and Xing Sun and Xiaoyu Tan and Chao Qu and Yuan Qi},
journal= {arXiv preprint arXiv:2510.16614},
year = {2025}
}