K-VIL:基于关键点的视觉模仿学习
机器人学
2023-07-26 v3
摘要
视觉模仿学习为机器人系统获取新颖操控技能提供了高效且直观的解决方案。然而,仅从视觉输入同时学习任务几何约束与控制策略仍是一个具有挑战性的问题。本文中,我们提出一种基于关键点视觉模仿(K-VIL)的方法,该方法从少量人类演示视频中自动提取稀疏的、以物体为中心且独立于具体本体的任务表示。该任务表示由主流形上基于关键点的几何约束、其关联的局部坐标系,以及任务执行所需的运动基元组成。我们的方法能够从单个演示视频中提取此类任务表示,并在有新演示时增量更新它们。为在全新场景中使用所学得的一组优先几何约束复现操控技能,我们引入一种新颖的基于关键点的导纳控制器。我们在若干真实世界应用中评估了我们的方法,展示了其处理杂乱场景、视角不匹配、类别物体的新实例以及物体位姿与形状大变化的能力,以及其在一次性与少样本模仿学习设置中的效率与鲁棒性。视频与源代码可在 https://sites.google.com/view/k-vil 获取。
引用
@article{arxiv.2209.03277,
title = {K-VIL: Keypoints-based Visual Imitation Learning},
author = {Jianfeng Gao and Zhi Tao and Noémie Jaquier and Tamim Asfour},
journal= {arXiv preprint arXiv:2209.03277},
year = {2023}
}