用于约束马尔可夫决策过程的侦察与规划算法
机器学习
2019-09-23 v1 机器学习
摘要
实际的强化学习问题通常被表述为约束马尔可夫决策过程(CMDP)问题,其中智能体必须在满足一组预设安全约束的同时最大化期望回报。在本研究中,我们提出了一种新颖的基于模拟器的方法,以在不牺牲任何安全约束的前提下近似求解 CMDP 问题。我们通过将 CMDP 分解为一对 MDP 来实现这一点:侦察 MDP 和规划 MDP。侦察 MDP 的目的是评估安全的动作集合,而规划 MDP 的目的是在仅使用侦察 MDP 授权的动作时最大化回报。侦察 MDP 可以为任意给定的安全约束集定义一组安全策略,而这组安全策略可用于求解具有不同奖励函数的另一个 CMDP 问题。我们的方法不仅在计算上比以往基于模拟器的 CMDP 方法要求更低,而且能够在高维环境中(包括涉及多个移动障碍物的环境)找到具有竞争力的奖励寻求策略。
引用
@article{arxiv.1909.09540,
title = {Reconnaissance and Planning algorithm for constrained MDP},
author = {Shin-ichi Maeda and Hayato Watahiki and Shintarou Okada and Masanori Koyama},
journal= {arXiv preprint arXiv:1909.09540},
year = {2019}
}