基于人类演示的信用分配安全学习
机器人学
2021-10-12 v1
摘要
在辅助机器人技术(例如用于导航的辅助轮椅)中,一个关键需求是通过用户交互来学习任务意图和安全保证,以确保任务的安全执行。对于用户目标不易定义的任务,从用户演示中学习是实现学习的关键步骤。然而,大多数从演示中学习(LfD)的机器人方法主要依赖最优演示以成功学习控制策略,而这从新手用户处获取具有挑战性。近期工作确实利用次优和失败演示来学习任务意图;但极少关注学习安全保证以防止重复经历失败,而这对辅助机器人至关重要。此外,交互式人机学习旨在最小化人类用户的努力以促进在现实世界中的部署。因此,要求用户标记演示中的不安全状态或关键帧不应成为学习的必要要求。在此,我们提出一种从一组次优和失败演示中学习安全值函数的算法,该函数用于生成实时安全控制滤波器。重要的是,我们开发了一种信用分配方法,可在无需人工标记或预先指定不安全区域知识的情况下从失败演示中提取失败状态。此外,我们通过融入用户定义的安全排序扩展了我们的公式,从而能根据用户偏好生成安全水平集,以实现用户特定的安全函数。通过使用次优和失败演示以及所开发的信用分配公式,我们得以在用户极少付出努力的情况下学习安全值函数,使其更易于在人机交互学习任务中广泛运用。
引用
@article{arxiv.2110.04633,
title = {Credit Assignment Safety Learning from Human Demonstrations},
author = {Ahalya Prabhakar and Aude Billard},
journal= {arXiv preprint arXiv:2110.04633},
year = {2021}
}
备注
Presented at AI-HRI symposium as part of AAAI-FSS 2021 (arXiv:2109.10836)