强化学习中基于集成误差的价值奖励探索
机器学习
2026-02-16 v1 人工智能
摘要
乐观的价值估计提供了强化学习(RL)中有向探索的一种机制。智能体依据价值估计值加上可视为价值奖励的量来进行贪心行动。价值奖励可以通过对奖励奖励上的价值函数进行估计来学习,将局部不确定性沿着奖励传播。然而,这种方法仅在看到来自该状态和动作的更高奖励奖励后,才会增加该动作的价值奖励。这种方法并不会鼓励智能体首次访问某个状态和动作。本文引入了一种名为 Value Bonuses with Ensemble errors (VBE) 的探索算法,该算法维护一组随机动作价值函数(RQFs)。VBE 使用这些 RQFs 估计误差来设计价值奖励,从而提供首次访问乐观和深层探索。关键思想是以这样一种方式设计这些 RQFs 的奖励,以便价值奖励可以减小到零。我们表明 VBE 在几个经典用于测试探索的环境上超过 Bootstrap DQN 和两种奖励奖励方法 (RND 和 ACB),并提供可扩展到更复杂环境如 Atari 的示范性实验。
引用
@article{arxiv.2602.12375,
title = {Value Bonuses using Ensemble Errors for Exploration in Reinforcement Learning},
author = {Abdul Wahab and Raksha Kumaraswamy and Martha White},
journal= {arXiv preprint arXiv:2602.12375},
year = {2026}
}
备注
Accepted at Reinforcement Learning Conference (RLC) 2025