中文

MaxInfoRL:通过信息增益最大化促进强化学习中的探索

机器学习 2025-08-01 v2 人工智能 机器人学

摘要

强化学习(RL)算法旨在平衡利用当前最佳策略与探索可能带来更高奖励的新选项。大多数常见的 RL 算法使用无向探索,即选择随机的动作序列。探索也可以使用内在奖励(如好奇心或模型认知不确定性)来进行引导。然而,有效地平衡任务奖励和内在奖励具有挑战性,且往往依赖于任务。在本研究中,我们引入了一个框架 MaxInfoRL,用于平衡内在和外在探索。MaxInfoRL 通过最大化关于底层任务的信息增益等内在奖励,将探索引向信息丰富的状态转换。当与 Boltzmann 探索相结合时,这种方法自然地在价值函数的最大化与状态、奖励和动作的熵的最大化之间进行权衡。我们表明,在多臂赌博机的简化设置中,我们的方法实现了次线性遗憾。然后,我们将这一通用表述应用于连续状态-动作空间的各种离策略无模型 RL 方法,产生了在困难探索问题和复杂场景(如视觉控制任务)中均取得卓越性能的新算法。

关键词

引用

@article{arxiv.2412.12098,
  title  = {MaxInfoRL: Boosting exploration in reinforcement learning through information gain maximization},
  author = {Bhavya Sukhija and Stelian Coros and Andreas Krause and Pieter Abbeel and Carmelo Sferrazza},
  journal= {arXiv preprint arXiv:2412.12098},
  year   = {2025}
}