弹性DQN集成方案:解决深度价值型强化学习中的高估问题
机器学习
2025-06-09 v1 人工智能
摘要
尽管已提出许多针对深度Q网络(DQN)的算法扩展,但关于不同改进如何相互作用的理解仍有限。特别是,多步和集成风格的扩展在减少高估偏差方面显示出前景,从而提高样本效率和算法稳定性。本文引入一种新算法,即弹性步进DQN集成(EEDQN),将集成与弹性步进更新相结合,以稳定算法性能。EEDQN旨�解决深度强化学习中的两个主要挑战:高估偏差和样本效率。我们在MinAtar基准测试中评估了EEDQN,该基准强调行为学习,同时降低表示复杂度。我们的结果表明,EEDQN在所有测试环境中均实现了稳健的性能,超越了基准DQN方法,并在大多数MinAtar环境中的最终回报中匹配或超越了最先进的集成DQNs。这些发现凸显了系统性地组合算法改进的潜力,并为集成和多步方法在谨慎集成时可获得显著提升提供了证据。
引用
@article{arxiv.2506.05716,
title = {Ensemble Elastic DQN: A novel multi-step ensemble approach to address overestimation in deep value-based reinforcement learning},
author = {Adrian Ly and Richard Dazeley and Peter Vamplew and Francisco Cruz and Sunil Aryal},
journal= {arXiv preprint arXiv:2506.05716},
year = {2025}
}