StereoMV2D: 一种用于鲁棒多视图3D目标检测的稀疏时序立体增强框架
计算机视觉与模式识别
2025-12-22 v1
摘要
多视图3D目标检测是自动驾驶感知中的一项基本任务,在检测精度和计算效率之间取得平衡仍然至关重要。基于稀疏查询的3D检测器通过一组可学习的查询从多视图图像中高效聚合与目标相关的特征,提供了一种简洁的端到端检测范式。在此基础上,MV2D利用2D检测结果为查询初始化提供高质量的目标先验,从而实现了更高的精度和召回率。然而,单帧2D检测中固有的深度模糊性仍然限制了3D查询生成的准确性。为了解决这个问题,我们提出了StereoMV2D,这是一个统一的框架,它将时序立体建模集成到了2D检测引导的多视图3D检测器中。通过利用同一目标在相邻帧之间的跨时序视差,StereoMV2D增强了深度感知并优化了查询先验,同时所有计算都在2D感兴趣区域(RoI)内高效执行。此外,一个动态置信门控机制通过学习源自帧间匹配矩阵和外观一致性的统计模式,自适应地评估时序立体线索的可靠性,确保了在目标外观变化和遮挡情况下的鲁棒检测。在nuScenes和Argoverse 2数据集上的大量实验表明,StereoMV2D在不引入显著计算开销的情况下实现了优越的检测性能。代码将发布在 https://github.com/Uddd821/StereoMV2D。
引用
@article{arxiv.2512.17620,
title = {StereoMV2D: A Sparse Temporal Stereo-Enhanced Framework for Robust Multi-View 3D Object Detection},
author = {Di Wu and Feng Yang and Wenhui Zhao and Jinwen Yu and Pan Liao and Benlian Xu and Dingwen Zhang},
journal= {arXiv preprint arXiv:2512.17620},
year = {2025}
}
备注
12 pages, 4 figures. This work has been submitted to the IEEE for possible publication