中文

FOMO-3D:使用视觉基础模型进行长尾 3D 目标检测

计算机视觉与模式识别 2026-03-10 v1 机器人学

摘要

为了导航复杂的交通环境,自动驾驶车辆必须识别涉及脆弱路用户或交通控制设备的众多语义类别。然而,许多安全关键目标(如施工工人)在正常交通条件下出现的频率不高,导致仅凭驾驶数据难以获得足够的训练样本。最近的视觉基础模型在大规模数据上进行训练,可作为外部先验知识的良好来源,以改进泛化能力。我们提出 FOMO-3D,首个利用视觉基础模型进行长尾 3D 检测的多模态 3D 检测器。具体而言,FOMO-3D 利用 OWLv2 和 Metric3Dv2 所提供的丰富语义和深度先验,在两阶段检测范式中构建提议——该范式首先使用基于激光雷达的分支和一种新颖的基于相机的分支生成提议,然后通过注意力机制特别关注来自 OWL 的图像特征进行细化。在真实驾驶数据上的评估表明,采用视觉基础模型并通过精心的多模态融合设计,可为长尾 3D 检测带来显著提升。项目网站位于 https://waabi.ai/fomo3d/。

关键词

引用

@article{arxiv.2603.08611,
  title  = {FOMO-3D: Using Vision Foundation Models for Long-Tailed 3D Object Detection},
  author = {Anqi Joyce Yang and James Tu and Nikita Dvornik and Enxu Li and Raquel Urtasun},
  journal= {arXiv preprint arXiv:2603.08611},
  year   = {2026}
}

备注

Published at 9th Annual Conference on Robot Learning (CoRL 2025)