中文

MVAT:用于弱监督3D目标检测的多视角感知教师网络

计算机视觉与模式识别 2025-09-10 v1

摘要

标注3D数据仍然是3D目标检测的一个昂贵瓶颈,这推动了依赖更易获取的2D框标注的弱监督标注方法的发展。然而,仅依赖2D框会引入投影歧义性,因为单个2D框可以对应多个有效的3D姿态。此外,在单视角设置下,部分物体可见性使得精确的3D框估计变得困难。我们提出了MVAT,这是一个利用序列数据中存在的时序多视角来解决这些挑战的新颖框架。我们的方法跨时间聚合以物体为中心的点云,以构建尽可能密集和完整的3D物体表示。采用了一种教师-学生蒸馏范式:教师网络从单视角学习,但其目标源自时间聚合的静态物体。然后,教师生成高质量的伪标签,学生网络学习从单视角预测静态和动态物体的这些标签。整个框架结合了一个多视角2D投影损失,以强制预测的3D框与所有可用的2D标注之间的一致性。在nuScenes和Waymo Open数据集上的实验表明,MVAT在弱监督3D目标检测中实现了最先进的性能,在不需要任何3D框标注的情况下,显著缩小了与全监督方法的差距。我们的代码可在我们的公共仓库获取(\href{https://github.com/CEA-LIST/MVAT}{code})。

关键词

引用

@article{arxiv.2509.07507,
  title  = {MVAT: Multi-View Aware Teacher for Weakly Supervised 3D Object Detection},
  author = {Saad Lahlali and Alexandre Fournier Montgieux and Nicolas Granger and Hervé Le Borgne and Quoc Cuong Pham},
  journal= {arXiv preprint arXiv:2509.07507},
  year   = {2025}
}

备注

Accepted at WACV 2026