LazyDAgger:减少交互式模仿学习中的上下文切换
机器人学
2021-07-22 v2 人工智能
摘要
当机器人学习自动化任务时,纠正性干预为人类监督者提供了一种直观的方法来协助机器人并传达关于期望行为的信息。然而,这些干预会给人类监督者带来显著负担,因为每次干预都会打断人类正在做的其他工作,在监督者与自主控制之间的每次上下文切换带来延迟,并需要时间来执行。我们提出 LazyDAgger,它扩展了交互式模仿学习(IL)算法 SafeDAgger,以减少监督者与自主控制之间的上下文切换。我们发现 LazyDAgger 在学习和执行期间均提升了所学策略的性能与鲁棒性,同时限制了监督者的负担。仿真实验表明,在 3 个连续控制任务上,LazyDAgger 相比 SafeDAgger 平均减少 60% 的上下文切换,同时保持最先进的策略性能。在使用 ABB YuMi 机器人的物理布料操控实验中,LazyDAgger 减少 60% 的上下文切换,同时在执行时取得比 SafeDAgger 高 60% 的成功率。
引用
@article{arxiv.2104.00053,
title = {LazyDAgger: Reducing Context Switching in Interactive Imitation Learning},
author = {Ryan Hoque and Ashwin Balakrishna and Carl Putterman and Michael Luo and Daniel S. Brown and Daniel Seita and Brijen Thananjeyan and Ellen Novoseller and Ken Goldberg},
journal= {arXiv preprint arXiv:2104.00053},
year = {2021}
}
备注
IEEE CASE 2021