面向机器人学习的人类视频中的对象中心 3D 运动场
机器人学
2025-06-05 v1 人工智能
计算机视觉与模式识别
机器学习
系统与控制
系统与控制
摘要
从人类视频中学习机器人控制策略是一个值得期待的方向,以扩大机器人学习的规模。然而,如何从视频中提取行动知识(或行动表示)以用于策略学习仍是关键挑战。现有的行动表示,如视频帧、像素流和点云流,都存在建模复杂性或信息丢失的局限性。本文提出使用对象中心 3D 运动场来表示人类视频中的行动,以用于机器人学习,并提出了从视频中提取该表示以实现零样例控制的新框架。我们在其实现中引入了两个新组件:1)用于从人类视频中稳健提取细粒度对象 3D 运动的“去噪” 3D 运动场估计器的新训练管道 2)支持跨 embodiment 迁移和策略对背景的泛化的稠密对象中心 3D 运动场预测架构。我们在真实世界环境中对系统进行评估。实验表明,我们的方法比最新方法将 3D 运动估计误差降低了 50% 以上,在 diverse 任务中实现 55% 的平均成功率(而现有方法仅能实现 %),甚至可以学习到类似插入这样的细粒度操作技能。
引用
@article{arxiv.2506.04227,
title = {Object-centric 3D Motion Field for Robot Learning from Human Videos},
author = {Zhao-Heng Yin and Sherry Yang and Pieter Abbeel},
journal= {arXiv preprint arXiv:2506.04227},
year = {2025}
}
备注
Project: https://zhaohengyin.github.io/3DMF