DQ3D:基于深度引导的查询用于交通场景中的基于 Transformer 的 3D 对象检测
计算机视觉与模式识别
2025-10-28 v1
摘要
从多视角图像进行 3D 对象检测在近年来引发了广泛关注。许多现有方法依赖于从 3D 参考点生成的对象查询来定位对象。然而,这些方法的一个局限是,一些参考点常常远离目标对象,可能导致误报检测。在本文中,我们提出了一种基于深度信息和 2D 检测结果的深度引导查询生成器(DQ3D),以确保参考点从对象的表面或内部采样。此外,为了解决当前帧中部分遮挡对象的问题,我们引入了一种混合注意力机制,将历史检测结果与深度引导查询融合,从而形成混合查询。在 nuScenes 数据集上的评估表明,我们的方法相对于基线模型在平均精度(mAP)上提升了 6.3%,在 NuScenes 检测得分(NDS)上提升了 4.3%。
引用
@article{arxiv.2510.23144,
title = {DQ3D: Depth-guided Query for Transformer-Based 3D Object Detection in Traffic Scenarios},
author = {Ziyu Wang and Wenhao Li and Ji Wu},
journal= {arXiv preprint arXiv:2510.23144},
year = {2025}
}