量子逆上下文视觉 Transformer (Q-ICVT):自动驾驶汽车 3D 目标检测的新前沿
计算机视觉与模式识别
2024-08-22 v1 人工智能
摘要
自动驾驶汽车(AV)领域主要利用 LiDAR 和相机数据的多模态融合,以实现比使用单一模态更好的性能。然而,由于相机的高分辨率与 LiDAR 的稀疏数据之间的差异,融合过程在检测远处目标时面临挑战。全局视角与局部细节的整合不足导致融合性能欠佳。为解决此问题,我们开发了一种创新的两阶段融合过程,称为量子逆上下文视觉 Transformer(Q-ICVT)。该方法利用量子概念中的绝热计算,创建了一种新颖的可逆视觉 Transformer,即全局绝热 Transformer(GAT)。GAT 以全局形式聚合稀疏的 LiDAR 特征与密集图像中的语义特征,用于跨模态集成。此外,局部融合稀疏专家(SELF)模块使用门控点融合方法,将稀疏的 LiDAR 3D 提案映射并编码原始点云的位置信息到密集的相机特征空间。我们的实验表明,Q-ICVT 在 Waymo 数据集上针对 L2 难度达到了 82.54 的 mAPH,比当前最先进的融合方法提升了 1.88%。我们还通过消融研究分析了 GAT 和 SELF,以突出 Q-ICVT 的影响。我们的代码可在 https://github.com/sanjay-810/Qicvt Q-ICVT 获取。
引用
@article{arxiv.2408.11207,
title = {Quantum Inverse Contextual Vision Transformers (Q-ICVT): A New Frontier in 3D Object Detection for AVs},
author = {Sanjay Bhargav Dharavath and Tanmoy Dam and Supriyo Chakraborty and Prithwiraj Roy and Aniruddha Maiti},
journal= {arXiv preprint arXiv:2408.11207},
year = {2024}
}
备注
The paper has been accepted as a short paper at CIKM '24