中文

弹性DQN集成方案:解决深度价值型强化学习中的高估问题

机器学习 2025-06-09 v1 人工智能

摘要

尽管已提出许多针对深度Q网络(DQN)的算法扩展,但关于不同改进如何相互作用的理解仍有限。特别是,多步和集成风格的扩展在减少高估偏差方面显示出前景,从而提高样本效率和算法稳定性。本文引入一种新算法,即弹性步进DQN集成(EEDQN),将集成与弹性步进更新相结合,以稳定算法性能。EEDQN旨�解决深度强化学习中的两个主要挑战:高估偏差和样本效率。我们在MinAtar基准测试中评估了EEDQN,该基准强调行为学习,同时降低表示复杂度。我们的结果表明,EEDQN在所有测试环境中均实现了稳健的性能,超越了基准DQN方法,并在大多数MinAtar环境中的最终回报中匹配或超越了最先进的集成DQNs。这些发现凸显了系统性地组合算法改进的潜力,并为集成和多步方法在谨慎集成时可获得显著提升提供了证据。

关键词

引用

@article{arxiv.2506.05716,
  title  = {Ensemble Elastic DQN: A novel multi-step ensemble approach to address overestimation in deep value-based reinforcement learning},
  author = {Adrian Ly and Richard Dazeley and Peter Vamplew and Francisco Cruz and Sunil Aryal},
  journal= {arXiv preprint arXiv:2506.05716},
  year   = {2025}
}