中文

HRP:面向机器人预训练的人类可操作性

机器人学 2024-07-29 v1 计算机视觉与模式识别

摘要

为了能够*泛化*到野外各种任务,机器人代理需要一种合适的表示(即视觉网络),以便根据高维视觉输入预测最优动作。然而,要学习这样一种表示需要大量多样化的训练数据,而在真实机器人上收集此类数据在成本上是不可行的。我们如何解决这个问题?本文提出使用来自互联网规模的人类视频,从环境和代理两个层面提取“可操作性”,并将其蒸馏到预训练表示中。我们提出了一个简单框架,用于在手、物体和接触“可操作性标签”上进行预训练,这些标签突出显示图像中相关物体以及如何与之交互。这些可操作性从带有帮助的常规计算机视觉模块的人类视频数据中自动提取,并用于微调现有表示。我们的方法可以有效地微调*任何*现有表示,结果模型在下游机器人任务中表现更佳。我们在实验中演示(使用3000多次机器人试验),表明这种可操作性预训练方案在5项真实任务中提升性能,最低提升15%,这些任务涉及三种不同的机器人形态(包括灵巧的手臂)。与 prior works 不同,此方法在3种不同的摄像头视角下均能提升性能。定量地,我们发现该方法在离群点情况下的泛化能力更高。

关键词

引用

@article{arxiv.2407.18911,
  title  = {HRP: Human Affordances for Robotic Pre-Training},
  author = {Mohan Kumar Srirama and Sudeep Dasari and Shikhar Bahl and Abhinav Gupta},
  journal= {arXiv preprint arXiv:2407.18911},
  year   = {2024}
}

备注

Accepted to Robotics Science and Systems 2024