Bootstrapped DQN 中信息价值增强的探索
机器学习
2025-11-24 v2 人工智能
摘要
深度强化学习中的高效探索仍然是一个基本挑战,尤其是在以高维状态和稀疏奖励为特征的环境中。依赖随机局部策略噪声的传统探索策略,如 -greedy 和 Boltzmann 探索方法,通常难以有效平衡探索和利用。在本文中,我们将(期望)信息价值 (EVOI) 的概念集成到著名的 Bootstrapped DQN 算法框架中,以增强算法的深度探索能力。具体来说,我们开发了两种新颖的算法,将学习信息价值的预期收益纳入 Bootstrapped DQN。我们的方法使用信息价值估计来衡量不同网络头之间意见的差异,并将探索驱动到最具潜力的区域。我们评估了我们的算法的性能及其利用随机网络初始化产生的固有不确定性的能力。我们在复杂的、稀疏奖励的 Atari 游戏中的实验表明,性能得到了提升,同时更好地利用了不确定性,并且重要的是,没有引入额外的超参数。
引用
@article{arxiv.2511.02969,
title = {Value of Information-Enhanced Exploration in Bootstrapped DQN},
author = {Stergios Plataniotis and Charilaos Akasiadis and Georgios Chalkiadakis},
journal= {arXiv preprint arXiv:2511.02969},
year = {2025}
}