CLIP-BEVFormer:利用真值流增强基于多视图图像的 BEV 检测器
计算机视觉与模式识别
2024-11-26 v2
摘要
自动驾驶是计算机视觉领域的一个关键领域,正在塑造交通的未来。在这一范式中,系统的骨干网络在解释复杂环境方面起着至关重要的作用。然而,在鸟瞰图(BEV)元素方面,一个显著的挑战是缺乏明确的监督。为了解决这一局限性,我们引入了 CLIP-BEVFormer,这是一种新颖的方法,利用对比学习技术的力量,通过真值信息流来增强基于多视图图像的 BEV 骨干网络。我们在具有挑战性的 nuScenes 数据集上进行了广泛的实验,并展示出相较于 SOTA 的显著且一致的改进。具体而言,在 3D 目标检测任务中,CLIP-BEVFormer 在 NDS 和 mAP 指标上分别比先前最佳的 BEV 模型取得了 8.5% 和 9.2% 的提升。
引用
@article{arxiv.2403.08919,
title = {CLIP-BEVFormer: Enhancing Multi-View Image-Based BEV Detector with Ground Truth Flow},
author = {Chenbin Pan and Burhaneddin Yaman and Senem Velipasalar and Liu Ren},
journal= {arXiv preprint arXiv:2403.08919},
year = {2024}
}
备注
CVPR 2024