中文

探索强化学习中分层世界模型的极限

机器学习 2024-06-04 v1

摘要

分层基于模型的强化学习(HMBRL)旨在结合基于模型的强化学习(MBRL)更好的样本效率优势与分层强化学习(HRL)的抽象能力,以高效解决复杂任务。尽管HMBRL潜力巨大,但仍缺乏广泛应用。在这项工作中,我们描述了一个新颖的HMBRL框架并对其进行了彻底评估。为了补充HRL典型的多层决策制定范式,我们构建了分层世界模型,该模型在不同时间抽象级别上模拟环境动态。这些模型用于训练一个智能体堆栈,该堆栈通过向其下属智能体提出目标来进行自上而下的通信。本研究的一个重点是探索静态且与环境无关的时间抽象,这允许在整个层次结构中同时训练模型和智能体。与大多数目标条件H(M)BRL方法不同,这也导致了相对低维的抽象动作。尽管我们的HMBRL方法在最终回合回报方面并未超越传统方法,但它成功地使用紧凑、低维的抽象动作促进了两个抽象级别上的决策制定。通过全面的实验发现,增强我们方法性能的一个核心挑战是世界模型堆栈抽象级别上的模型利用问题。我们深入研究了这个问题,讨论了其对领域的影响,并提出了未来研究的方向以克服这一挑战。通过分享这些发现,我们旨在为完善HMBRL方法的更广泛讨论做出贡献,并协助开发用于复杂决策环境的更有效的自主学习系统。

关键词

引用

@article{arxiv.2406.00483,
  title  = {Exploring the limits of Hierarchical World Models in Reinforcement Learning},
  author = {Robin Schiewer and Anand Subramoney and Laurenz Wiskott},
  journal= {arXiv preprint arXiv:2406.00483},
  year   = {2024}
}

备注

26 pages, 14 figures