ASHA:基于人在回路强化学习的辅助遥操作
机器人学
2022-02-08 v1 人机交互
机器学习
摘要
构建辅助接口以通过任意、高维、含噪输入(例如眼动注视的网络摄像头图像)控制机器人可能具有挑战性,尤其是在缺乏自然“默认”接口的情况下需要推断用户期望的动作时。基于用户对系统性能的在线反馈进行强化学习为该问题提供了自然的解决方案,并使接口能够适应个体用户。然而,这种方法往往需要大量的人在回路训练数据,尤其在反馈稀疏时。我们提出了一种从稀疏用户反馈中高效学习的分层解决方案:我们使用离线预训练获得有用、高层机器人行为的潜在嵌入空间,进而使系统专注于利用在线用户反馈学习从用户输入到期望高层行为的映射。关键洞见是,访问预训练策略使系统能从稀疏奖励中学到比朴素 RL 算法更多的东西:利用预训练策略,系统可使用成功的任务执行,在事后重新标注用户在失败执行中实际意图做什么。我们主要通过一项有 12 名参与者的用户研究来评估我们的方法,参与者使用网络摄像头及其眼动注视在三个模拟机器人操作领域执行任务:拨动电灯开关、打开搁架门以取内部物体、以及旋转阀门。结果表明,我们的方法能在不到 10 分钟的在线训练内,从稀疏奖励中成功学习将 128 维注视特征映射到 7 维关节力矩,并无缝帮助采用不同注视策略的用户,同时适应网络摄像头输入、任务和环境中的分布偏移。
引用
@article{arxiv.2202.02465,
title = {ASHA: Assistive Teleoperation via Human-in-the-Loop Reinforcement Learning},
author = {Sean Chen and Jensen Gao and Siddharth Reddy and Glen Berseth and Anca D. Dragan and Sergey Levine},
journal= {arXiv preprint arXiv:2202.02465},
year = {2022}
}
备注
Accepted to IEEE Conference on Robotics and Automation (ICRA) 2022