中文

对视觉-运动预训练数据集的无偏审视

机器人学 2023-10-16 v1 计算机视觉与模式识别

摘要

视觉表示学习在机器人领域大有前景,但却严重受限于机器人数据集的稀缺与同质化。近期工作通过大规模但域外数据(例如以自我为中心的交互视频)预训练视觉表示,再迁移到目标机器人任务来解决该问题。尽管该领域高度聚焦于开发更好的预训练算法,我们发现数据集选择对此范式的成功同样重要。毕竟,表示只能学到预训练数据集中存在的结构或先验。为此,我们将焦点从算法翻转,转而对机器人预训练进行以数据集为中心的分析。我们的发现对该领域的一些常识提出了质疑。我们观察到传统视觉数据集(如 ImageNet、Kinetics 和 100 Days of Hands)作为视觉-运动表示学习的选项竟出奇地具竞争力,且预训练数据集的图像分布比其规模更重要。最后,我们表明常用仿真基准并非真实世界性能的可靠代理,且简单的正则化策略可大幅改善真实世界策略学习。https://data4robotics.github.io

关键词

引用

@article{arxiv.2310.09289,
  title  = {An Unbiased Look at Datasets for Visuo-Motor Pre-Training},
  author = {Sudeep Dasari and Mohan Kumar Srirama and Unnat Jain and Abhinav Gupta},
  journal= {arXiv preprint arXiv:2310.09289},
  year   = {2023}
}

备注

Accepted to CoRL 2023