实时安全地训练自治系统:高效结合人类示范与干预
人工智能
2018-11-30 v2 人机交互
机器人学
摘要
本文研究如何通过从人类示范与干预中学习,利用不同形式的人类交互来实时安全地训练自治系统。我们实现了自治系统学习循环(Cycle-of-Learning)的两个组件,该框架用于结合多种模态的人类交互。当前工作利用人类示范通过模仿学习教导期望行为,随后借助干预数据纠正模仿学习器产生的不期望行为,从而在仅数分钟训练后安全地教导自治智能体新任务。我们在一项自治栖息任务中演示了该方法,使用一架具有连续横滚、俯仰、偏航和油门指令的四旋翼,以及在高保真模拟环境中由下视相机捕获的图像。与仅从示范学习相比,我们的方法在同等人类交互量下提升了任务完成性能,同时平均减少 32% 的数据以达到该性能。这提供了证据表明,结合多种人类交互模态能够提升自治系统策略的训练速度与整体性能。
引用
@article{arxiv.1810.11545,
title = {Efficiently Combining Human Demonstrations and Interventions for Safe Training of Autonomous Systems in Real-Time},
author = {Vinicius G. Goecks and Gregory M. Gremillion and Vernon J. Lawhern and John Valasek and Nicholas R. Waytowich},
journal= {arXiv preprint arXiv:1810.11545},
year = {2018}
}
备注
9 pages, 6 figures