结合AI规划模型的分层强化学习
人工智能
2022-09-30 v2
摘要
序列决策的两种常见方法是AI规划(AIP)和强化学习(RL),两者各有优缺点。AI规划具有可解释性,易于与符号知识集成,且通常效率较高,但需要预先给出逻辑领域规范,并对噪声敏感;强化学习仅需指定奖励,对噪声具有鲁棒性,但样本效率低,且不易融入外部知识。我们提出了一种将高层规划与强化学习相结合的集成方法,在保留可解释性、迁移性和效率的同时,允许对低层规划动作进行鲁棒学习。我们的方法通过建立AI规划问题的状态转移模型与马尔可夫决策过程(MDP)的抽象状态转移系统之间的对应关系,从AIP算子中定义分层强化学习(HRL)中的选项。通过添加内在奖励以鼓励MDP与AIP转移模型之间的一致性来学习选项。我们在MiniGrid和N-rooms环境中比较了RL与HRL算法的性能,展示了我们的方法相对于现有方法的优势。
引用
@article{arxiv.2203.00669,
title = {Hierarchical Reinforcement Learning with AI Planning Models},
author = {Junkyu Lee and Michael Katz and Don Joven Agravante and Miao Liu and Geraud Nangue Tasse and Tim Klinger and Shirin Sohrabi},
journal= {arXiv preprint arXiv:2203.00669},
year = {2022}
}
备注
30 pages, 15 figures