中文

以数据为中心重新审视预训练视觉模型在机器人学习中的应用

计算机视觉与模式识别 2025-03-25 v2 机器人学

摘要

预训练视觉模型(PVMs)是现代机器人学的基础,但其最佳配置仍不明确。通过系统评估,我们发现尽管 DINO 和 iBOT 在视觉运动控制与感知任务中优于 MAE,但在非(单)对象中心(NOC)数据上训练时表现不佳——这一局限与它们学习对象中心表示的能力减弱密切相关。本研究表明,从非对象中心机器人数据集中形成对象中心表示的能力是 PVMs 成功的关键。受此发现启发,我们设计了 SlotMIM,该方法通过引入语义瓶颈以减少原型数量来促进对象性的涌现,并引入跨视图一致性正则化以鼓励多视图不变性,从而诱导对象中心表示。我们的实验涵盖了在对象中心、场景中心、网络爬取及自我中心数据上的预训练。在所有设置中,我们的方法学习到了可迁移的表示,并在图像识别、场景理解和机器人学习评估中取得了优于先前工作的显著改进。当使用百万规模数据集进行扩展时,我们的方法还展现出卓越的数据效率与可扩展性。我们的代码和模型已在 https://github.com/CVMI-Lab/SlotMIM 公开。

关键词

引用

@article{arxiv.2503.06960,
  title  = {A Data-Centric Revisit of Pre-Trained Vision Models for Robot Learning},
  author = {Xin Wen and Bingchen Zhao and Yilun Chen and Jiangmiao Pang and Xiaojuan Qi},
  journal= {arXiv preprint arXiv:2503.06960},
  year   = {2025}
}

备注

Accepted by CVPR 2025