中文

无地图导航中安全深度强化学习的在线安全属性收集与精炼

人工智能 2023-02-15 v1 机器人学

摘要

安全性对于在真实场景中部署深度强化学习(DRL)算法至关重要。近期提出的验证方法可量化 DRL 策略在输入输出关系上违反所谓属性(properties)的次数。然而,此类属性为硬编码且需要任务级知识,使其在具有挑战性的安全关键任务中难以应用。为此,我们引入在线属性收集与精炼(CROP)框架,以在训练时设计属性。CROP 利用代价信号识别不安全交互,并用以塑形安全属性。进而,我们提出一种精炼策略来合并建模相似不安全交互的属性。我们的评估比较了使用标准硬编码属性与 CROP 生成属性计算违规次数的益处。我们在多个机器人无地图导航任务中评估了该方法,并表明相较先前的安全 DRL 方法,用 CROP 计算的违规度量带来了更高回报与更低违规率。

关键词

引用

@article{arxiv.2302.06695,
  title  = {Online Safety Property Collection and Refinement for Safe Deep Reinforcement Learning in Mapless Navigation},
  author = {Luca Marzari and Enrico Marchesini and Alessandro Farinelli},
  journal= {arXiv preprint arXiv:2302.06695},
  year   = {2023}
}

备注

Accepted at the 2023 IEEE International Conference on Robotics and Automation (ICRA). Marzari and Marchesini contributed equally