中文

DQ3D:基于深度引导的查询用于交通场景中的基于 Transformer 的 3D 对象检测

计算机视觉与模式识别 2025-10-28 v1

摘要

从多视角图像进行 3D 对象检测在近年来引发了广泛关注。许多现有方法依赖于从 3D 参考点生成的对象查询来定位对象。然而,这些方法的一个局限是,一些参考点常常远离目标对象,可能导致误报检测。在本文中,我们提出了一种基于深度信息和 2D 检测结果的深度引导查询生成器(DQ3D),以确保参考点从对象的表面或内部采样。此外,为了解决当前帧中部分遮挡对象的问题,我们引入了一种混合注意力机制,将历史检测结果与深度引导查询融合,从而形成混合查询。在 nuScenes 数据集上的评估表明,我们的方法相对于基线模型在平均精度(mAP)上提升了 6.3%,在 NuScenes 检测得分(NDS)上提升了 4.3%。

关键词

引用

@article{arxiv.2510.23144,
  title  = {DQ3D: Depth-guided Query for Transformer-Based 3D Object Detection in Traffic Scenarios},
  author = {Ziyu Wang and Wenhao Li and Ji Wu},
  journal= {arXiv preprint arXiv:2510.23144},
  year   = {2025}
}