中文

RCDINO:利用 DINOv2 语义特征增强雷达-相机三维目标检测

计算机视觉与模式识别 2025-08-22 v1

摘要

三维目标检测对于自动驾驶和机器人技术至关重要,它依赖于相机和雷达多模态数据的有效融合。本工作提出了 RCDINO,一个基于多模态 Transformer 的模型,该模型通过将视觉骨干特征与来自预训练 DINOv2 基础模型的语义丰富表示相融合来增强视觉骨干特征。这种方法丰富了视觉表示,提高了模型的检测性能,同时保持了与基线架构的兼容性。在 nuScenes 数据集上的实验表明,RCDINO 在雷达-相机模型中达到了最先进的性能,取得了 56.4 NDS 和 48.1 mAP。我们的实现代码可在 https://github.com/OlgaMatykina/RCDINO 获取。

关键词

引用

@article{arxiv.2508.15353,
  title  = {RCDINO: Enhancing Radar-Camera 3D Object Detection with DINOv2 Semantic Features},
  author = {Olga Matykina and Dmitry Yudin},
  journal= {arXiv preprint arXiv:2508.15353},
  year   = {2025}
}

备注

Accepted for publication in Optical Memory and Neural Networks, 2025