中文

迭代 Q 网络:深层强化学习中超越单步 Bellman 更新

机器学习 2025-04-04 v6 人工智能

摘要

强化学习方法的绝大多数都受计算量和获取有效动作价值函数估计所需的数据要求的影响,这些估计最终决定了整体性能质量以及学习过程的样本效率。通常,通过交替进行经验贝尔曼算子近似的应用和后续投影步骤到所选函数空间来估计动作价值函数。人们已经观察到,这一方案可以被推广到一次性执行多个贝尔曼算子迭代,从而惠及底层学习算法。然而,迄今为止,尤其是在高维问题中,有效实现这一思想仍然具有挑战性。本文引入了迭代 Q 网络(i-QN),这是一种新颖的原则方法,使能够通过学习一系列动作价值函数来实现多个连续贝尔曼更新,其中每个函数都作为下一个的目标。我们证明了 i-QN 在理论上是有据可依的,并且可以无缝集成到基于价值的强化学习方法和演员-评论家方法中。我们在 Atari 2600 游戏和 MuJoCo 连续控制问题中经验性地展示了 i-QN 的优势。

关键词

引用

@article{arxiv.2403.02107,
  title  = {Iterated $Q$-Network: Beyond One-Step Bellman Updates in Deep Reinforcement Learning},
  author = {Théo Vincent and Daniel Palenicek and Boris Belousov and Jan Peters and Carlo D'Eramo},
  journal= {arXiv preprint arXiv:2403.02107},
  year   = {2025}
}

备注

Published at TMLR: https://openreview.net/forum?id=Lt2H8Bd8jF