中文

有限时域半马尔可夫决策过程中后悔最小化算法的选项相关分析

机器学习 2023-05-12 v1 信息论 math.IT

摘要

大量真实世界的强化学习(RL)任务具有复杂且异构的结构,使得端到端(或扁平)方法难以适用甚至不可行。分层强化学习(HRL)通过对任务进行便捷的多级分解提供了解决这些问题的通用方案,使其可解。尽管在实践中常被使用,但很少有工作提供理论保证来有效证明这一结果。因此,相较于标准扁平方法,何时偏好此类方法尚不清楚。在本工作中,我们给出了有限时域问题中后悔最小化算法所承受后悔的一个选项相关上界。我们阐明性能提升源于分层结构所施加的时间抽象所引起的规划时域缩减。然后,聚焦于 HRL 方法的一个子集,即选项框架,我们强调了可用选项的平均持续时间如何影响规划时域,并进而影响后悔本身。最后,我们放宽了拥有预训练选项的假设,以展示在特定情形下,从零开始分层学习可能优于使用标准方法。

关键词

引用

@article{arxiv.2305.06936,
  title  = {An Option-Dependent Analysis of Regret Minimization Algorithms in Finite-Horizon Semi-Markov Decision Processes},
  author = {Gianluca Drappo and Alberto Maria Metelli and Marcello Restelli},
  journal= {arXiv preprint arXiv:2305.06936},
  year   = {2023}
}