李雅普诺夫障碍策略优化
机器学习
2021-03-17 v1 人工智能
机器人学
摘要
在真实世界中部署强化学习(RL)智能体要求智能体满足安全约束。当前RL智能体在探索环境时不考虑这些约束,可能导致硬件损坏甚至环境中其他智能体受损。我们提出一种新方法LBPO,其使用基于李雅普诺夫的障碍函数将策略更新限制于每次训练迭代的安全集中。我们的方法还允许用户控制智能体相对于环境中约束的保守程度。LBPO在训练期间约束违反次数上显著优于最先进基线,同时在性能上具竞争力。此外,我们的分析揭示,如CPO和SDDPG等基线主要依赖回溯而非安全投影来确保安全,这揭示了先前方法可能未能有效限制约束违反次数的原因。
引用
@article{arxiv.2103.09230,
title = {Lyapunov Barrier Policy Optimization},
author = {Harshit Sikchi and Wenxuan Zhou and David Held},
journal= {arXiv preprint arXiv:2103.09230},
year = {2021}
}