可实现抽象:近最优的分层强化学习
机器学习
2025-12-05 v1 人工智能
摘要
分层强化学习(HRL)的主要焦点是研究如何通过组合为较小子任务计算的局部解,以模块化方式更有效地解决大型马尔可夫决策过程(MDP)。尽管抽象在强化学习中具有非常直观的作用,但HRL文献中提出的大多数MDP抽象概念要么表达能力有限,要么不具备形式化的效率保证。本文通过定义可实现抽象(Realizable Abstractions)来解决这些基本问题,这是一种通用低层MDP与其相关高层决策过程之间的新关系。我们提出的概念避免了非马尔可夫性问题,并具有理想的近最优性保证。实际上,我们证明,对于可实现抽象,任何抽象策略都可以通过适当的选项组合转化为低层MDP的近最优策略。如论文所示,这些选项可以表示为特定约束MDP的解。基于这些发现,我们提出了RARL,一种新的HRL算法,它利用输入中给出的可实现抽象,返回组合式的、近最优的低层策略。我们证明RARL是概率近似正确的,它在多项式数量的样本内收敛,并且对抽象中的不准确性具有鲁棒性。
引用
@article{arxiv.2512.04958,
title = {Realizable Abstractions: Near-Optimal Hierarchical Reinforcement Learning},
author = {Roberto Cipollone and Luca Iocchi and Matteo Leonetti},
journal= {arXiv preprint arXiv:2512.04958},
year = {2025}
}