MIM4D:面向自动驾驶表征学习的基于多视角视频的掩码建模
计算机视觉与模式识别
2024-03-14 v1
摘要
从海量多视角视频数据中学习鲁棒且可扩展的视觉表征仍然是计算机视觉和自动驾驶领域的一项挑战。现有的预训练方法要么依赖于带有 3D 标注的昂贵监督学习,限制了可扩展性;要么专注于单帧或单目输入,忽略了时序信息。我们提出了 MIM4D,一种基于双重掩码图像建模 (MIM) 的新型预训练范式。MIM4D 通过对掩码后的多视角视频输入进行训练,同时利用了空间和时间关系。它利用连续的场景流构建伪 3D 特征,并将其投影到 2D 平面进行监督。为了解决缺乏密集 3D 监督的问题,MIM4D 采用 3D 体积可微渲染重建像素来学习几何表征。我们证明,MIM4D 在 nuScenes 数据集上的自动驾驶视觉表征学习任务中取得了 SOTA 性能。它在多个下游任务上显著提升了现有方法,包括 BEV 分割(提升 8.7% IoU)、3D 目标检测(提升 3.5% mAP)和 HD 地图构建(提升 1.4% mAP)。我们的工作为自动驾驶领域的大规模表征学习提供了新的选择。代码和模型已发布于 https://github.com/hustvl/MIM4D
引用
@article{arxiv.2403.08760,
title = {MIM4D: Masked Modeling with Multi-View Video for Autonomous Driving Representation Learning},
author = {Jialv Zou and Bencheng Liao and Qian Zhang and Wenyu Liu and Xinggang Wang},
journal= {arXiv preprint arXiv:2403.08760},
year = {2024}
}