SAMBA:基于模型的安全主动强化学习
机器学习
2020-06-18 v1 人工智能
机器人学
机器学习
摘要
在本文中,我们提出 SAMBA,一种结合概率建模、信息论与统计学各方面的安全强化学习新框架。我们的方法基于 PILCO 构建,通过使用新颖的(半)度量进行样本外高斯过程评估,并通过支持条件风险价值(conditional-value-at-risk)约束的多目标问题优化,从而实现主动探索。我们在涉及低维与高维状态表示的各种安全动力系统基准上评估了我们的算法。我们的结果表明,与最先进的方法相比,样本数与违规次数均减少了数个数量级。最后,我们通过详细分析我们的主动度量与安全约束,对该框架的有效性提供了直观解释。
引用
@article{arxiv.2006.09436,
title = {SAMBA: Safe Model-Based & Active Reinforcement Learning},
author = {Alexander I. Cowen-Rivers and Daniel Palenicek and Vincent Moens and Mohammed Abdullah and Aivar Sootla and Jun Wang and Haitham Ammar},
journal= {arXiv preprint arXiv:2006.09436},
year = {2020}
}