中文

通过弱到强诱导扩展多相机 3D 目标检测

计算机视觉与模式识别 2024-04-11 v1

摘要

在鸟瞰图(BEV)表示的推动下,多相机 3D 目标检测(MC3D-Det)的出现标志着 3D 目标检测的显著进步。有效扩展 MC3D-Det 训练可以适应各种相机参数和城市场景,为 MC3D-Det 基础模型铺平道路。然而,MC3D-Det 方法的多视图融合阶段在训练期间依赖于非适定的单目感知,而非环视细化能力,导致了我们称之为“环视细化退化”的现象。为此,我们的研究提出了一个弱到强诱导框架,旨在增强环视细化的同时保持稳健的单目感知。具体而言,我们的框架采用了在不同子集上训练的弱调优专家,每个专家固有地偏向于特定的相机配置和场景。这些有偏专家可以学习单目退化的感知,这有助于多视图融合阶段增强环视细化能力。此外,提出了一种复合蒸馏策略,以整合 2D 基础模型的通用知识与任务特定信息。最后,对于 MC3D-Det 联合训练,设计了精细的数据集合并策略,以解决相机数量和相机参数不一致的问题。我们为 MC3D-Det 建立了多数据集联合训练基准,并充分评估了现有方法。此外,我们证明了所提出的框架在多个基线上带来了泛化且显著的提升。我们的代码位于 \url{https://github.com/EnVision-Research/Scale-BEV}。

关键词

引用

@article{arxiv.2404.06700,
  title  = {Scaling Multi-Camera 3D Object Detection through Weak-to-Strong Eliciting},
  author = {Hao Lu and Jiaqi Tang and Xinli Xu and Xu Cao and Yunpeng Zhang and Guoqing Wang and Dalong Du and Hao Chen and Yingcong Chen},
  journal= {arXiv preprint arXiv:2404.06700},
  year   = {2024}
}