从观看中学习:从人类视频中提取操纵轨迹的可扩展方法
机器人学
2025-12-02 v1 计算机视觉与模式识别
摘要
收集大规模机器人模型训练所需的高质量数据,通常依赖真实机器人平台,这种方式既费时又昂贵,无论是通过遥操作还是脚本化演示。为了扩展数据收集,许多研究人员转而利用在线上可获取的人类操纵视频。然而,当前方法主要关注手部检测或物体姿态估计,未能充分利用这些视频中嵌入的丰富交互线索。本文提出了一种新方法,结合视频理解的大型基础模型和点跟踪技术,从而提取操纵过程中所有任务相关关键点的稠密轨迹。这一方法更全面地利用了来自互联网的大规模人类演示视频。实验结果表明,我们的方法能够在整个操纵过程中准确跟踪关键点,为更可扩展和数据高效的机器人学习铺平了道路。
引用
@article{arxiv.2512.00024,
title = {Learning from Watching: Scalable Extraction of Manipulation Trajectories from Human Videos},
author = {X. Hu and G. Ye},
journal= {arXiv preprint arXiv:2512.00024},
year = {2025}
}
备注
Accepted to RSS 2025 Workshop