中文

MonoDINO-DETR:利用视觉基础模型的深度增强单目3D目标检测

计算机视觉与模式识别 2025-02-04 v1

摘要

本文提出了利用视觉基础模型的泛化特征提取能力来增强单目3D目标检测模型性能的新方法。与通常因深度估计不准确且依赖多阶段目标检测流程的传统CNN方法不同,本研究采用基于视觉Transformer(ViT)的基础模型作为骨干网络,该模型擅长捕捉全局特征以进行深度估计。它集成了检测Transformer(DETR)架构,以单阶段方式同时提升深度估计和目标检测性能。具体而言,引入了一个分层特征融合模块,从基础模型中提取更丰富的视觉特征,进一步增强特征提取能力。通过结合在大规模数据上训练的深度估计模型并进行迁移学习微调,进一步提高了深度估计的准确性。此外,在Transformer解码器中使用考虑参考点和2D边界框尺寸的查询,增强了识别性能。在KITTI 3D基准数据集和从高海拔赛车环境中收集的自定义数据集上的定量和定性评估表明,所提出的模型优于近期最先进的方法。代码可在https://github.com/JihyeokKim/MonoDINO-DETR获取。

关键词

引用

@article{arxiv.2502.00315,
  title  = {MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model},
  author = {Jihyeok Kim and Seongwoo Moon and Sungwon Nah and David Hyunchul Shim},
  journal= {arXiv preprint arXiv:2502.00315},
  year   = {2025}
}

备注

8 pages, 8 figures