基于时空高斯过程的时变安全马尔可夫决策过程安全探索
人工智能
2018-09-13 v1
摘要
在许多现实应用中(例如行星探测、机器人导航),自主智能体必须能够在保证安全的前提下探索空间。强化学习与机器人领域的大多数安全探索算法基于安全特征先验已知且时不变的假设。本文提出一种称为ST-SafeMDP的学习算法,用于探索马尔可夫决策过程(MDP),其基于安全特征先验未知且时变的假设。在此设定下,智能体探索MDP的同时约束进入由安全函数低于某一阈值所定义的不安全状态的概率。未知且时变的安全值使用时空高斯过程建模。然而,仍存在智能体在收缩的真实安全空间中可能无可行动作的问题。为解决该问题,我们构建了一个相对于未来观测的最坏情形下最大化安全状态累计数量的问题。该方法在两个仿真设定中展示了有效性,其中一个使用了真实月球地形数据。
引用
@article{arxiv.1809.04232,
title = {Safe Exploration in Markov Decision Processes with Time-Variant Safety using Spatio-Temporal Gaussian Process},
author = {Akifumi Wachi and Hiroshi Kajino and Asim Munawar},
journal= {arXiv preprint arXiv:1809.04232},
year = {2018}
}
备注
12 pages, 7 figures