RCDINO:利用 DINOv2 语义特征增强雷达-相机三维目标检测
计算机视觉与模式识别
2025-08-22 v1
摘要
三维目标检测对于自动驾驶和机器人技术至关重要,它依赖于相机和雷达多模态数据的有效融合。本工作提出了 RCDINO,一个基于多模态 Transformer 的模型,该模型通过将视觉骨干特征与来自预训练 DINOv2 基础模型的语义丰富表示相融合来增强视觉骨干特征。这种方法丰富了视觉表示,提高了模型的检测性能,同时保持了与基线架构的兼容性。在 nuScenes 数据集上的实验表明,RCDINO 在雷达-相机模型中达到了最先进的性能,取得了 56.4 NDS 和 48.1 mAP。我们的实现代码可在 https://github.com/OlgaMatykina/RCDINO 获取。
引用
@article{arxiv.2508.15353,
title = {RCDINO: Enhancing Radar-Camera 3D Object Detection with DINOv2 Semantic Features},
author = {Olga Matykina and Dmitry Yudin},
journal= {arXiv preprint arXiv:2508.15353},
year = {2025}
}
备注
Accepted for publication in Optical Memory and Neural Networks, 2025