面向多视角 3D 目标检测的几何感知无监督域适应框架 BEVUDA++
计算机视觉与模式识别
2025-09-18 v1
摘要
以鸟瞰图(BEV)视觉感知为导向的感知方法在自主驾驶领域具有巨大的潜力。近期研究侧重于提高效率或精度,却忽略了域迁移问题,导致实际迁移时性能显著下降。我们识别了实际跨域场景中的主要域差异,致力于首次解决多视角 3D 目标检测中的域适应(DA)挑战。鉴于 BEV 感知方法包含多个组件,跨几何空间(如 2D、3D 体素、BEV)的域差异累积为 BEV 域适应提出了重大挑战。本文提出一种创新的几何感知教师-学生框架 BEVUDA++,以消除此问题,包括可靠深度教师(RDT)和几何一致学生(GCS)模型。具体而言,RDT 通过不确定性估计有效融合目标激光点云与可靠深度预测,生成基于深度的信心信息,增强从目标域提取的体素和 BEV 特征,这些特征对于理解目标域至关重要。为协同降低域差异,GCS 将多个空间的特征映射到统一的几何嵌入空间,从而缩小两种域之间数据分布的差距。此外,我们引入一种新型不确定性引导的指数移动平均(UEMA)以进一步减少因域差异导致的误差累积。为证明所提方法的优越性,我们在四个跨域场景中执行了全面实验,在 BEV 3D 目标检测任务中实现了最先进的性能,例如在 Day-Night 适应任务中实现了 12.9% 的 NDS 和 9.5% 的 mAP 提升。
引用
@article{arxiv.2509.14151,
title = {BEVUDA++: Geometric-aware Unsupervised Domain Adaptation for Multi-View 3D Object Detection},
author = {Rongyu Zhang and Jiaming Liu and Xiaoqi Li and Xiaowei Chi and Dan Wang and Li Du and Yuan Du and Shanghang Zhang},
journal= {arXiv preprint arXiv:2509.14151},
year = {2025}
}
备注
Accepted by IEEE TCSVT