BEVUDA:面向域自适应 BEV 3D 目标检测的多几何空间对齐
计算机视觉与模式识别
2024-03-28 v2
摘要
以视觉为中心的鸟瞰图(BEV)感知在自动驾驶中已展现出可观潜力。近期工作主要聚焦于提升效率或精度,却忽视了面对环境变化时的挑战,导致迁移性能严重退化。针对 BEV 感知,我们指出了典型真实世界跨域场景中存在显著域间隙,并全面解决多视角 3D 目标检测的域自适应(DA)问题。由于 BEV 感知方法复杂且包含多个组件,多个几何空间(即 2D、3D 体素、BEV)上的域偏移累积使 BEV DA 更具挑战性。本文中,我们提出多空间对齐师生(MATS)框架以缓解域偏移累积,其由深度感知教师(DAT)与几何空间对齐学生(GAS)模型组成。DAT 巧妙结合目标激光雷达与可靠深度预测构建深度感知信息,在体素与 BEV 特征空间中提取目标域特有知识,随后将多空间的充分域知识迁移给学生模型。为联合减轻域偏移,GAS 将多几何空间特征投影至共享几何嵌入空间,并减小两域间数据分布距离。为验证方法有效性,我们在三种跨域场景上进行 BEV 3D 目标检测实验,取得了最先进的性能。
引用
@article{arxiv.2211.17126,
title = {BEVUDA: Multi-geometric Space Alignments for Domain Adaptive BEV 3D Object Detection},
author = {Jiaming Liu and Rongyu Zhang and Xiaoqi Li and Xiaowei Chi and Zehui Chen and Ming Lu and Yandong Guo and Shanghang Zhang},
journal= {arXiv preprint arXiv:2211.17126},
year = {2024}
}
备注
Accepted by ICRA2024