中文

弹性步长 DQN:一种缓解深度 Q 网络高估问题的新型多步算法

机器学习 2022-10-10 v1

摘要

深度 Q 网络算法(DQN)是首个使用深度神经网络在多个 Atari 学习环境中成功超越人类水平表现的强化学习算法。然而,发散与不稳定行为一直是 DQN 中长期存在的问题。这种不稳定行为常表现为 QQ 值的高估,通常称为高估偏差。为解决高估偏差与发散行为,已有若干启发式扩展被提出。值得注意的是,多步更新已被证明能大幅减少不稳定行为并改善智能体训练性能。然而,智能体通常对多步更新视界(nn)的选择高度敏感,且我们的经验实验表明,选取不当的静态 nn 值在多数情况下会导致比单步 DQN 更差的性能。受 nn 步 DQN 的成功以及多步更新对高估偏差影响的启发,本文提出一种称为“弹性步长 DQN”(ES-DQN)的新算法。它基于所访问状态的相似性动态变化多步更新中的步长视界。我们的经验评估表明,在多个 OpenAI Gym 环境中,ES-DQN 优于固定 nnnn 步更新、Double DQN 与 Average DQN,同时缓解了高估偏差。

关键词

引用

@article{arxiv.2210.03325,
  title  = {Elastic Step DQN: A novel multi-step algorithm to alleviate overestimation in Deep QNetworks},
  author = {Adrian Ly and Richard Dazeley and Peter Vamplew and Francisco Cruz and Sunil Aryal},
  journal= {arXiv preprint arXiv:2210.03325},
  year   = {2022}
}