面向鸟瞰图多视角三维目标检测的域泛化
计算机视觉与模式识别
2023-03-06 v1
摘要
鸟瞰图(BEV)中的多视角三维目标检测(MV3D-Det)因其低成本和高效率而受到广泛关注。尽管仅使用相机的三维目标检测新算法不断被提出,但当输入图像的域与训练域不同时,它们大多面临严重的性能下降风险。本文中,我们首先分析了 MV3D-Det 任务中域差距的成因。基于协变量偏移假设,我们发现该差距主要归因于 BEV 的特征分布,其由深度估计质量和 2D 图像特征表示共同决定。为获得鲁棒的深度预测,我们提出通过将以度量深度预测转换为尺度不变深度预测,将深度估计与相机内参(即焦距)解耦,并利用单应性执行动态透视增强以增加外参(即相机位姿)的多样性。此外,我们修改焦距值以创建多个伪域,并构建对抗训练损失以鼓励特征表示更具域无关性。无需额外技巧,我们的方法(称为 DG-BEV)成功缓解了在未见目标域上的性能下降,且不损害源域精度。在 Waymo、nuScenes 和 Lyft 等多个公开数据集上的大量实验证明了我们方法的泛化性和有效性。据我们所知,这是首个探索 MV3D-Det 域泛化方法的系统性研究。
引用
@article{arxiv.2303.01686,
title = {Towards Domain Generalization for Multi-view 3D Object Detection in Bird-Eye-View},
author = {Shuo Wang and Xinhai Zhao and Hai-Ming Xu and Zehui Chen and Dameng Yu and Jiahao Chang and Zhen Yang and Feng Zhao},
journal= {arXiv preprint arXiv:2303.01686},
year = {2023}
}
备注
Accepted to CVPR 2023