中文

在线强化学习中的规划新视角

机器学习 2024-06-04 v1 人工智能

摘要

本文探讨了一种新的基于模型的强化学习方法,采用背景规划:混合(近似)动态规划更新和模型无关更新,类似于 Dyna 架构。带有学习模型的背景规划通常比诸如 Double DQN 等模型无关方法更差,尽管前者使用了大量的内存和计算资源。根本问题在于,学习得到的模型可能不准确,尤其是在迭代多步时常常生成无效状态。本文通过将背景规划限制在一组(抽象) subgoals 上并仅学习局部、以 subgoals 为条件的模型来规避这一限制。这种目标空间规划(Goal-space planning, GSP)方法更具计算效率,天然地为更快的长期规划包含时间抽象,并且避免了完全学习状态转移动力学。我们展示了我们的 GSP 算法能够以一种有助于各种基本学习者在不同领域中显著加快学习速度的方式从抽象空间传递价值。

关键词

引用

@article{arxiv.2406.01562,
  title  = {A New View on Planning in Online Reinforcement Learning},
  author = {Kevin Roice and Parham Mohammad Panahi and Scott M. Jordan and Adam White and Martha White},
  journal= {arXiv preprint arXiv:2406.01562},
  year   = {2024}
}

备注

Published in the Planning and Reinforcement Learning Workshop at ICAPS 2024. arXiv admin note: text overlap with arXiv:2206.02902