FlatFusion: 深入探讨基于稀疏Transformer的相机-LiDAR融合在自动驾驶中的细节
计算机视觉与模式识别
2025-07-01 v2
摘要
多模态传感器数据(如相机和LiDAR)的集成是自动驾驶场景中的常见方法。近期高效点云Transformer的进展强调了稀疏格式信息融合的有效性。在融合方面,由于图像块在像素空间中是密集的且深度模糊,因此需要额外的设计考量以实现有效融合。本文对基于Transformer的稀疏相机-LiDAR融合的设计选择进行了全面探索。该研究涵盖了图像到3D和LiDAR到2D映射策略、注意力邻居分组、单模态tokenizer以及Transformer的微观结构。通过整合我们研究中揭示的最有效原则,我们提出了FlatFusion,一个精心设计的稀疏相机-LiDAR融合框架。值得注意的是,FlatFusion显著优于现有的稀疏Transformer方法,包括UniTR、CMT和SparseFusion,在nuScenes验证集上以PyTorch实现了73.7 NDS和10.1 FPS。
引用
@article{arxiv.2408.06832,
title = {FlatFusion: Delving into Details of Sparse Transformer-based Camera-LiDAR Fusion for Autonomous Driving},
author = {Yutao Zhu and Xiaosong Jia and Xinyu Yang and Junchi Yan},
journal= {arXiv preprint arXiv:2408.06832},
year = {2025}
}
备注
Accepted by ICRA 2025