CVCP-Fusion:基于隐式深度估计的3D边界框预测
计算机视觉与模式识别
2024-10-17 v2 机器学习
摘要
将LiDAR和摄像机视角数据融合已成为3D目标检测中的常见方法。然而,现有方法在点级融合输入流,丢弃了从摄像机特征中获得的语义信息。本文提出了跨视图中心点融合(Cross-View Center Point-Fusion),这是一种最新的方法,通过在地平面坐标系(BEV)空间融合摄像机和LiDAR特征,以保留摄像机流的语义密度,同时融合LiDAR流的空间数据。我们的架构利用了已建立算法的某些方面,如Cross-View Transformer和CenterPoint,并以并行方式运行其背部,实现实时处理和应用的高效计算。本文发现,尽管在二维地图视图表示中进行隐式计算的深度估计可能足够准确,但在三维世界视图空间进行精确边界框预测需要显式计算的几何和空间信息。
引用
@article{arxiv.2410.11211,
title = {CVCP-Fusion: On Implicit Depth Estimation for 3D Bounding Box Prediction},
author = {Pranav Gupta and Rishabh Rengarajan and Viren Bankapur and Vedansh Mannem and Lakshit Ahuja and Surya Vijay and Kevin Wang},
journal= {arXiv preprint arXiv:2410.11211},
year = {2024}
}
备注
7 pages, 5 figures. arXiv admin note: text overlap with arXiv:2205.02833 by other authors