中文

Langevin DQN

机器学习 2021-02-24 v2 人工智能 机器学习

摘要

解决深度探索(强化学习中的重要挑战)的算法一直依赖于通过集成或其他超模型、探索奖励或访问计数分布来表示认知不确定性。一个开放问题是:深度探索是否可由追踪单一点估计的增量式强化学习算法实现,而无需为认知不确定性额外增加复杂度。我们肯定地回答了该问题。具体而言,我们开发了Langevin DQN,一种仅以高斯噪声扰动参数更新的DQN变体,并通过计算研究证明所提算法实现了深度探索。我们也对Langevin DQN如何实现深度探索提供一些直观解释。此外,我们给出了Langevin DQN算法的一种改进以提升计算效率。

关键词

引用

@article{arxiv.2002.07282,
  title  = {Langevin DQN},
  author = {Vikranth Dwaracherla and Benjamin Van Roy},
  journal= {arXiv preprint arXiv:2002.07282},
  year   = {2021}
}

备注

5 figures, 14 pages