面向第三人称模仿学习的自监督解耦表示学习
机器人学
2021-08-03 v1 计算机视觉与模式识别
机器学习
摘要
人类通过观察他人来学习模仿。然而,机器人模仿学习通常需要第一人称视角(FPV)的专家演示。为每个机器人收集此类 FPV 视频可能成本高昂。第三人称模仿学习(TPIL)的概念是通过观察第三人称视角(TPV)下的其他智能体来学习动作策略,类似于人类的学习方式。这最终允许利用来自许多不同数据源的 TPV 人类和机器人演示视频进行策略学习。在本文中,我们针对具有自运动特性的机器人任务,提出了一种 TPIL 方法。尽管许多涉及地面/空中移动的机器人任务通常包含相机自运动的动作,但针对此类任务的 TPIL 研究仍然有限。在此类任务中,FPV 和 TPV 的观察结果在视觉上差异很大;FPV 显示自运动,而智能体的外观仅在 TPV 中可观测。为了实现更好的 TPIL 状态学习,我们提出了解耦表示学习方法。我们使用双自编码器结构,结合表示置换损失和时间对比损失,以确保状态和视角表示得到良好解耦。我们的实验证明了该方法的有效性。
引用
@article{arxiv.2108.01069,
title = {Self-Supervised Disentangled Representation Learning for Third-Person Imitation Learning},
author = {Jinghuan Shang and Michael S. Ryoo},
journal= {arXiv preprint arXiv:2108.01069},
year = {2021}
}
备注
Preprint. 8 pages. Accepted at IROS 2021