中文

通用强化学习中巨大动作空间的精确约简

机器学习 2020-12-21 v1 人工智能 系统与控制 系统与控制 机器学习

摘要

强化学习(RL)框架形式化了通过交互进行学习的概念。许多现实问题具有巨大的状态空间和/或动作空间,如围棋、星际争霸、蛋白质折叠和机器人学,或是非马尔可夫的,这给 RL 算法带来显著挑战。本工作中我们通过动作序列化来解决大动作空间问题,这能显著减小动作空间规模,甚至以延长规划周期为代价降至两个动作。我们针对任意基于历史的过程,给出了所有相关量的显式精确构造与等价性证明。在 MDP 情形下,这可帮助自举的 RL 算法。本工作中我们展示了非 MDP 情形下的动作二值化如何显著改进极端状态聚合(ESA)界。ESA 借助一个替代马尔可夫过程,可将任意(非 MDP、非遍历、基于历史)的 RL 问题投射到固定规模的非马尔可夫状态空间中。其优点在于 ESA 享有与马尔可夫模型类似的最优性保证,但缺点是聚合状态空间规模随动作空间大小呈指数增长。本工作中我们通过二值化动作空间修补此问题,给出了该二值化 ESA 状态数的上界,其对原动作空间大小呈对数关系,实现了双指数级的改进。

关键词

引用

@article{arxiv.2012.10200,
  title  = {Exact Reduction of Huge Action Spaces in General Reinforcement Learning},
  author = {Sultan Javed Majeed and Marcus Hutter},
  journal= {arXiv preprint arXiv:2012.10200},
  year   = {2020}
}

备注

A variant of this paper was presented at the AAAI-2021 proceedings