基于无记忆选项与选项-观测初始化集的 POMDP 强化学习
人工智能
2017-09-13 v2 机器学习
摘要
许多现实世界中的强化学习问题具有分层特性,并且通常表现出一定程度的部分可观测性。虽然分层和部分可观测性通常被分开处理(例如通过结合循环神经网络和选项),但我们表明,在许多情况下同时解决这两个问题更为简单且高效。更具体地说,我们使选项的初始化集取决于先前执行的选项,并表明具有此类选项-观测初始化集 (OOIs) 的选项至少与有限状态控制器 (FSCs) 具有同等的表达能力,后者是 POMDP 中学习的一种最先进方法。OOIs 易于基于任务的直观描述进行设计,能产生可解释的策略,并保持顶层策略和选项策略无记忆。我们的实验表明,OOIs 允许智能体在具有挑战性的 POMDP 中学习最优策略,同时比基于选项的循环神经网络具有更高的样本效率。
引用
@article{arxiv.1708.06551,
title = {Reinforcement Learning in POMDPs with Memoryless Options and Option-Observation Initiation Sets},
author = {Denis Steckelmacher and Diederik M. Roijers and Anna Harutyunyan and Peter Vrancx and Hélène Plisnier and Ann Nowé},
journal= {arXiv preprint arXiv:1708.06551},
year = {2017}
}