引导探索:通过内在动机增强 LLM 推理
机器学习
2026-02-02 v6
摘要
强化学习 (RL) 已成为增强大型语言模型推理能力的关键方法。然而,类似于近端策略优化和群体相对策略优化等常见 RL 方法 suffer from稀疏、基于结果的奖励和弱探索激励,这限制了其有效性。 Specifically,稀疏奖励在困难问题上提供有限的反馈,并引入偏见,使偏好熟悉的轨迹而非新颖的推理路径。这在本质上需要迭代推理的复杂任务中至关重要。为克服这些挑战,我们提出了基于内在动机引导的探索以增强推理 (IMAGINE),该方法提供稠密奖励并鼓励探索。IMAGINE 引入了三个创新点:一个轨迹感知的探索奖励有效地减少了 token 级别的偏见;一个误差条件奖励分配在困难样本上促进高效探索的同时稳定训练;以及一种保持优势的集成机制在学习期间保持分布的完整性。在四个公开数据集上的实验表明,IMAGINE 在 AIME 2024 上提升了 22.23% 的性能。
引用
@article{arxiv.2505.17621,
title = {Navigate the Unknown: Enhancing LLM Reasoning with Intrinsic Motivation Guided Exploration},
author = {Jingtong Gao and Ling Pan and Yejing Wang and Rui Zhong and Chi Lu and Maolin Wang and Qingpeng Cai and Peng Jiang and Xiangyu Zhao},
journal= {arXiv preprint arXiv:2505.17621},
year = {2026}
}