用于端到端移动操作的贝叶斯模仿学习
机器人学
2022-02-16 v1 机器学习
摘要
本工作中,我们研究并展示了一种贝叶斯方法在多传感器输入模仿学习中的益处,应用于移动机械臂开启办公室门的任务。为策略增补额外传感器输入(如 RGB + 深度相机)是提升机器人感知能力的直接途径,尤其对于在不同情境下可能偏好不同传感器的任务。当我们把多传感器机器人学习扩展到非结构化真实世界环境(如办公室、家庭)及更复杂的机器人行为时,也愈发依赖模拟器以降低成本、提升效率与安全性。随之,跨多传感器模态的仿真到现实鸿沟也增大,使模拟验证更困难。我们展示,使用变分信息瓶颈(Variational Information Bottleneck,Alemi et al., 2016)正则化卷积神经网络,可以传感器无关的方式改善对留出域的泛化并缩小仿真到现实鸿沟。作为副作用,所学嵌入还为各传感器提供了有用的模型不确定性估计。我们证明,我们的方法能够帮助缩小仿真到现实鸿沟,并基于对各传感器情境不确定性的理解成功融合 RGB 与深度模态。在真实办公室环境中,我们实现了 96% 的任务成功率,较基线提升 +16%。
引用
@article{arxiv.2202.07600,
title = {Bayesian Imitation Learning for End-to-End Mobile Manipulation},
author = {Yuqing Du and Daniel Ho and Alexander A. Alemi and Eric Jang and Mohi Khansari},
journal= {arXiv preprint arXiv:2202.07600},
year = {2022}
}