中文

FSMDet:面向全稀疏 3D 检测器的视觉引导特征扩散

计算机视觉与模式识别 2024-09-12 v1 人工智能

摘要

全稀疏 3D 检测近年来受到广泛关注。然而,这些框架中特征的稀疏性挑战了有效的提案生成,因其扩散过程有限。此外,追求效率也导致仅有少数工作关注视觉辅助的全稀疏模型。本文提出 FSMDet(Fully Sparse Multi-modal Detection),利用视觉信息引导激光雷达特征扩散过程,同时保持管线的高效。具体而言,大多数全稀疏方法聚焦于复杂的自定义中心融合扩散/回归算子。然而,我们观察到只要完成充分的对象重建,即使最简单的插值算子也能获得令人满意的结果。基于此,我们将视觉引导扩散分为两个模块:形状恢复层(SRLayer)和自扩散层(SDLayer)。前者利用 RGB 信息恢复对象可见部分的形状,后者则利用视觉先验将特征进一步扩散至中心区域。实验表明,我们的方法成功提升了仅使用激光雷达的先前全稀疏模型性能,并在多模态模型中达到 SOTA 水平。同时,由于稀疏架构,本方法在推理过程中的效率可比先前 SOTA 方法提高约 5 倍。

关键词

引用

@article{arxiv.2409.06945,
  title  = {FSMDet: Vision-guided feature diffusion for fully sparse 3D detector},
  author = {Tianran Liu and Morteza Mousa Pasandi and Robert Laganiere},
  journal= {arXiv preprint arXiv:2409.06945},
  year   = {2024}
}

备注

Accepted by European Conference on Computer Vision (ECCV) 2024 workshop on VCAD