Track2Act:从互联网视频预测点轨迹以实现通用机器人操控
机器人学
2024-08-12 v2 计算机视觉与模式识别
摘要
我们旨在学习通用目标条件策略,使机器人能够在无测试时序适应地操控未见对象。虽然典型方法依赖大量演示数据,但我们提出一种利用网络视频预测合理交互计划的做法,并学习一种面向机器人动作的任务无关转换。我们的框架Track2Act 基于目标预测图像中点在未来时间步的合理运动轨迹,可使用网络上多样化视频进行训练,包括人类和机器人操作日常物品的视频。我们利用这些 2D 轨迹推断待操控物体的刚性变换序列,从而获得可在开放环条件下执行的机器人末端执行器姿态。随后,我们通过在少量本体特定演示下训练的闭环策略来细化该开放环计划。我们展示了该方法通过结合可扩展学习的轨迹预测与仅需最小领域内机器人专用数据的残差策略,实现了多样化的通用机器人操控,并呈现了在未见任务、物品和场景下的广泛实际结果。
引用
@article{arxiv.2405.01527,
title = {Track2Act: Predicting Point Tracks from Internet Videos enables Generalizable Robot Manipulation},
author = {Homanga Bharadhwaj and Roozbeh Mottaghi and Abhinav Gupta and Shubham Tulsiani},
journal= {arXiv preprint arXiv:2405.01527},
year = {2024}
}
备注
ECCV 2024. Last 3 authors contributed equally