从人类视频中提取可供性作为机器人通用表征
机器人学
2023-04-18 v1 人工智能
计算机视觉与模式识别
机器学习
神经与进化计算
摘要
构建能够通过观看人类来理解和学习交互的机器人激发了若干视觉问题。然而,尽管在静态数据集上取得了一些成功结果,当前模型如何直接用于机器人仍不明确。本文中,我们旨在以环境为中心的方式利用人类交互视频来弥合这一差距。利用互联网上人类行为视频,我们训练了一个视觉可供性模型,用于估计场景中人类可能交互的位置与方式。这些行为可供性的结构直接使机器人能够执行许多复杂任务。我们展示了如何将我们的可供性模型无缝集成到四种机器人学习范式中,包括离线模仿学习、探索、目标条件学习以及用于强化学习的动作参数化。我们展示了我们称为VRB的方法在4个真实世界环境、超过10个不同任务以及2个在野外运行的机器人平台上的有效性。结果、可视化与视频见 https://robo-affordances.github.io/
引用
@article{arxiv.2304.08488,
title = {Affordances from Human Videos as a Versatile Representation for Robotics},
author = {Shikhar Bahl and Russell Mendonca and Lili Chen and Unnat Jain and Deepak Pathak},
journal= {arXiv preprint arXiv:2304.08488},
year = {2023}
}
备注
Accepted at CVPR 2023. Website at https://robo-affordances.github.io/