中文

CA-W3D:利用上下文感知知识进行弱监督单目3D检测

计算机视觉与模式识别 2025-08-05 v2 人工智能

摘要

弱监督单目3D检测虽然减少了标注负担,但往往难以捕获可靠3D推理所需的全局上下文。传统的标签高效方法聚焦于目标中心特征,忽视了复杂场景中至关重要的上下文语义关系。在本工作中,我们提出了上下文感知弱监督单目3D检测(CA-W3D),以两阶段训练范式解决这一限制。具体而言,我们首先引入了一个预训练阶段,采用区域级目标对比匹配(ROCM),将来自可训练单目3D编码器和冻结的开词汇2D视觉定位模型的区域目标嵌入进行对齐。这种对齐鼓励单目编码器区分场景特定属性并获取更丰富的上下文知识。在第二阶段,我们引入了一个结合双到一蒸馏(D2OD)机制的伪标签训练过程,该机制有效地将上下文先验传递至单目编码器,同时保持空间保真度并在推理期间维持计算效率。在公共KITTI基准上进行的广泛实验证明了我们方法的有效性,在所有指标上超越了SOTA方法,突显了上下文感知知识在弱监督单目3D检测中的重要性。

关键词

引用

@article{arxiv.2503.04154,
  title  = {CA-W3D: Leveraging Context-Aware Knowledge for Weakly Supervised Monocular 3D Detection},
  author = {Chupeng Liu and Runkai Zhao and Weidong Cai},
  journal= {arXiv preprint arXiv:2503.04154},
  year   = {2025}
}

备注

Accepted by IROS 2025