我们在为具身智能寻找人工视觉皮层的道路上处于何处?
计算机视觉与模式识别
2024-02-05 v2 人工智能
机器学习
机器人学
摘要
我们提出了针对具身 AI 的预训练视觉表征(PVRs)或视觉“基础模型”的最大且最全面的实证研究。首先,我们构建了 CortexBench,其包含跨越运动、导航、灵巧操作和移动操控的 17 项不同任务。接下来,我们系统评估现有 PVRs,发现没有哪一个具有普遍主导性。为研究预训练数据规模与多样性的影响,我们结合了来自 7 个不同来源的超过 4000 小时自我中心视频(超过 430 万张图像)与 ImageNet,利用掩码自编码(MAE)在该数据的不同切片上训练不同规模的视觉Transformer。与先前工作的推断相反,我们发现扩大数据集规模与多样性并不能普遍提升性能(但在平均意义上有所提升)。我们最大的模型名为 VC-1,在平均上优于所有先前的 PVRs,但同样不具有普遍主导性。接着,我们展示对 VC-1 进行任务或领域特定适配可带来显著增益,适配后的 VC-1 在 CortexBench 的所有基准上取得了具有竞争力或优于已知最佳结果的性能。最后,我们展示了真实世界硬件实验,其中 VC-1 与适配后的 VC-1 优于最强的已有 PVR。总体而言,本文未提出新技术,而是进行了严格的系统评估、得出关于 PVRs 的一系列发现(其中某些情况反驳了先前工作在狭窄领域中的结论),并为研究社区开源了代码与模型(训练耗费超过 10000 GPU 小时)。
引用
@article{arxiv.2303.18240,
title = {Where are we in the search for an Artificial Visual Cortex for Embodied Intelligence?},
author = {Arjun Majumdar and Karmesh Yadav and Sergio Arnaud and Yecheng Jason Ma and Claire Chen and Sneha Silwal and Aryan Jain and Vincent-Pierre Berges and Pieter Abbeel and Jitendra Malik and Dhruv Batra and Yixin Lin and Oleksandr Maksymets and Aravind Rajeswaran and Franziska Meier},
journal= {arXiv preprint arXiv:2303.18240},
year = {2024}
}
备注
Project website: https://eai-vc.github.io