利用非马尔可夫抽象降低通用强化学习的规划复杂度
人工智能
2021-12-28 v1 机器学习
摘要
通用强化学习(GRL)领域从最基础出发形式化了序列决策问题。交互历史构成了系统的“基础”状态,它从不重复。一方面,这种通用性使 GRL 能够建模几乎所有可能的领域,例如 Bandits、MDP、POMDP、PSR 以及基于历史的环境。另一方面,一般而言,GRL 中的近最优策略是完整历史的函数,这不仅阻碍了学习,也阻碍了 GRL 中的规划。规划部分通常的解决途径是赋予智能体底层过程的马尔可夫抽象。因此,它可以使用任意 MDP 规划算法来寻找近最优策略。极端状态聚合(ESA)框架将这一思想扩展到非马尔可夫抽象,且不牺牲通过(代理)MDP 进行规划的可能性。ESA 的一个显著特征是,它证明了代理 MDP 所需状态数的上界为 (其中 为动作数, 为折扣因子, 为最优性间隙),该上界对\emph{所有}领域\emph{一致}成立。尽管通用上界的可能性相当引人注目,我们表明该上界非常宽松。我们提出了一种新颖的非 MDP 抽象,其允许好得多的上界 。此外,我们表明通过使用动作序列化方法,该上界可进一步改进至 。
引用
@article{arxiv.2112.13386,
title = {Reducing Planning Complexity of General Reinforcement Learning with Non-Markovian Abstractions},
author = {Sultan J. Majeed and Marcus Hutter},
journal= {arXiv preprint arXiv:2112.13386},
year = {2021}
}