ThriftyDAgger:面向交互式模仿学习的预算感知新颖性与风险门控
机器人学
2021-09-20 v1 人工智能
摘要
有效的机器人学习常需在线人类反馈与干预,这可能耗费大量人类时间,从而引出交互式模仿学习的核心挑战:能否控制干预的时机与长度,以同时促进学习并减轻人类负担?本文提出ThriftyDAgger,一种在给定人类干预预算下主动查询人类监督者的算法。ThriftyDAgger使用习得的切换策略,仅在状态满足以下充分条件时请求干预:(1)新颖,即机器人策略无参考行为可模仿;或(2)风险,即机器人对任务完成信心不足。为检测后者,我们引入一种估计当前机器人策略下风险的新指标。在仿真与物理线缆布线实验中的结果表明,ThriftyDAgger的干预准则比先前算法更有效地平衡了任务表现与监督者负担。ThriftyDAgger也可应用于执行时,其在仿真与物理任务上均达到100%成功率。一项用户研究(N=10)中,用户在控制三机器人编队的同时执行专注任务,结果表明相较次优算法,ThriftyDAgger使人类与机器人表现分别提升58%与80%,同时减轻了监督者负担。
引用
@article{arxiv.2109.08273,
title = {ThriftyDAgger: Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning},
author = {Ryan Hoque and Ashwin Balakrishna and Ellen Novoseller and Albert Wilcox and Daniel S. Brown and Ken Goldberg},
journal= {arXiv preprint arXiv:2109.08273},
year = {2021}
}
备注
CoRL 2021 Oral