面向多视图三维目标检测的多视图注意力上下文化
计算机视觉与模式识别
2024-05-21 v1
摘要
我们提出了多视图注意力上下文化(MvACon),一种简单而有效的方法,用于改进基于查询的多视图三维(MV3D)目标检测中的二维到三维特征提升。尽管基于查询的 MV3D 目标检测领域取得了显著进展,但现有技术往往存在以下问题:由于计算成本高昂,在基于密集注意力的提升中缺乏对高分辨率二维特征的利用;或者在基于稀疏注意力的提升中,三维查询对多尺度二维特征的 grounding 不够密集。我们提出的 MvACon 采用了一种表示密集但计算稀疏的注意力特征上下文化方案,一石二鸟地解决了上述问题,且该方案不依赖于特定的二维到三维特征提升方法。在实验中,所提出的 MvACon 在 nuScenes 基准上进行了全面测试,使用了 BEVFormer 及其最新的三维可变形注意力(DFA3D)变体以及 PETR,结果显示出一致的检测性能提升,尤其是在位置、朝向和速度预测方面的性能提升。在使用 BEVFormer 的 Waymo-mini 基准上也进行了测试,并获得了类似的提升。我们定性和定量地表明,基于全局聚类的上下文能够有效地编码 MV3D 目标检测的密集场景级上下文。我们提出的 MvACon 所取得的充满希望的结果印证了计算机视觉中的格言——“(上下文化的)特征至关重要”。
引用
@article{arxiv.2405.12200,
title = {Multi-View Attentive Contextualization for Multi-View 3D Object Detection},
author = {Xianpeng Liu and Ce Zheng and Ming Qian and Nan Xue and Chen Chen and Zhebin Zhang and Chen Li and Tianfu Wu},
journal= {arXiv preprint arXiv:2405.12200},
year = {2024}
}
备注
Accepted by CVPR2024