中文

M&M3D:面向多视角三维目标检测的多数据集训练与高效网络

计算机视觉与模式识别 2023-11-03 v1

摘要

在本研究中,我提出了一种基于仅相机数据与鸟瞰图(Bird's-Eye-View, BEV)地图的多视角三维目标检测网络结构。我的工作基于当前关键挑战——域适应与视觉数据迁移。尽管已有许多优秀的仅相机三维目标检测方法被不断提出,但许多研究在网络于源域训练而在不同目标域测试时面临严重的性能下降风险。随后我发现令人惊讶的是,边界框与类别的预测仍依赖于二维网络。基于对各三维数据集的域差距假设,我发现它们在相同 BEV 地图尺寸与相机数据传输上仍共享相似的数据提取。因此,为分析域差距对当前方法的影响并充分利用数据集与真实世界间的三维空间信息,我提出了一种迁移学习方法与 Transformer 结构,在 NuScenes-mini 与 Lyft 上研究三维目标检测。通过多数据集训练与来自 Transformer 的检测头,该网络利用三维锚查询与三维位置信息展现出良好的数据迁移性能与高效检测性能。仅依靠少量源数据与现有大模型预训练权重,该高效网络即能在新目标域上取得具竞争力的结果。此外,我的研究将三维信息作为可用语义信息,并将二维多视角图像特征融入视觉-语言迁移设计中。在最终的三维锚框预测与物体分类中,我的网络在标准三维目标检测指标上取得良好结果,不同于各训练域上无需任何微调的针对特定数据集的模型。

关键词

引用

@article{arxiv.2311.00986,
  title  = {M&M3D: Multi-Dataset Training and Efficient Network for Multi-view 3D Object Detection},
  author = {Hang Zhang},
  journal= {arXiv preprint arXiv:2311.00986},
  year   = {2023}
}