无地图导航中安全深度强化学习的在线安全属性收集与精炼
人工智能
2023-02-15 v1 机器人学
摘要
安全性对于在真实场景中部署深度强化学习(DRL)算法至关重要。近期提出的验证方法可量化 DRL 策略在输入输出关系上违反所谓属性(properties)的次数。然而,此类属性为硬编码且需要任务级知识,使其在具有挑战性的安全关键任务中难以应用。为此,我们引入在线属性收集与精炼(CROP)框架,以在训练时设计属性。CROP 利用代价信号识别不安全交互,并用以塑形安全属性。进而,我们提出一种精炼策略来合并建模相似不安全交互的属性。我们的评估比较了使用标准硬编码属性与 CROP 生成属性计算违规次数的益处。我们在多个机器人无地图导航任务中评估了该方法,并表明相较先前的安全 DRL 方法,用 CROP 计算的违规度量带来了更高回报与更低违规率。
引用
@article{arxiv.2302.06695,
title = {Online Safety Property Collection and Refinement for Safe Deep Reinforcement Learning in Mapless Navigation},
author = {Luca Marzari and Enrico Marchesini and Alessandro Farinelli},
journal= {arXiv preprint arXiv:2302.06695},
year = {2023}
}
备注
Accepted at the 2023 IEEE International Conference on Robotics and Automation (ICRA). Marzari and Marchesini contributed equally