VidBot:从自然2D人类视频中学习可泛化3D动作以实现零样本机器人操作
机器人学
2025-03-31 v2 计算机视觉与模式识别
摘要
未来的机器人被设想为能够执行各种家庭任务的多功能系统。关键问题仍然在于,如何在最小化物理机器人学习的同时弥合具身鸿沟,因为物理机器人学习从根本上难以扩展。我们认为,从自然人类视频中学习为机器人操作任务提供了一种有前景的解决方案,因为互联网上已经存在大量相关数据。在这项工作中,我们提出了 VidBot,这是一个利用从自然单目纯 RGB 人类视频中学习到的3D可供性来实现零样本机器人操作的框架。VidBot 利用流水线从中提取显式表示,即视频中的3D手部轨迹,结合深度基础模型与运动恢复结构技术,重建出与具身无关的、时间一致的度量尺度3D可供性表示。我们引入了一个由粗到细的可供性学习模型,该模型首先从像素空间中识别粗略动作,然后利用扩散模型生成细粒度的交互轨迹,该过程以粗略动作为条件,并由测试时约束进行引导以实现上下文感知的交互规划,从而能够对全新场景和具身实现实质性泛化。大量实验证明了 VidBot 的有效性,它在零样本设置下的13项操作任务中显著优于对比方法,并且能够在真实世界环境中跨机器人系统无缝部署。VidBot 为利用日常人类视频使机器人学习更具可扩展性铺平了道路。
引用
@article{arxiv.2503.07135,
title = {VidBot: Learning Generalizable 3D Actions from In-the-Wild 2D Human Videos for Zero-Shot Robotic Manipulation},
author = {Hanzhi Chen and Boyang Sun and Anran Zhang and Marc Pollefeys and Stefan Leutenegger},
journal= {arXiv preprint arXiv:2503.07135},
year = {2025}
}
备注
Accepted to CVPR 2025