MonoVQD:基于变分查询去噪与自蒸馈的单目3D目标检测
计算机视觉与模式识别
2025-06-19 v1
摘要
从单张图像精确定位3D目标是单目3D检测中的核心挑战。尽管DETR类架构提供了强大的范式,但其直接应用于该领域仍面临内在局限,无法实现最佳性能。我们的工作通过引入MonoVQD框架来根本性地推动DETR-based单目3D检测。首先,我们提出了Mask Separated Self-Attention机制,使其能够将去噪过程集成到DETR架构中。这一改进提高了匈牙利匹配的稳定性,以实现一致的优化目标。其次,我们提出了Variational Query Denoising技术,以解决传统去噪方法中梯度消失的问题,这严重限制了去噪过程的效率。这一方法显式地引入随机性以缓解这一根本性限制,从而实现显著的性能提升。最后,我们引入一种精细的自蒸馈策略,利用后续解码器层的洞见来协同改善早期层的查询质量,从而放大迭代细化过程。严格的实验表明,MonoVQD在具有挑战性的KITTI单目基准上实现了卓越的性能。凭借其广泛适用性,MonoVQD的核心组件无缝集成到其他架构中,即使在nuScenes数据集上的多视角3D检测场景中也能实现显著的性能提升,凸显了其强大的泛化能力。
引用
@article{arxiv.2506.14835,
title = {MonoVQD: Monocular 3D Object Detection with Variational Query Denoising and Self-Distillation},
author = {Kiet Dang Vu and Trung Thai Tran and Duc Dung Nguyen},
journal= {arXiv preprint arXiv:2506.14835},
year = {2025}
}