SSLFusion:面向多模态3D目标检测的尺度与空间对齐潜在融合模型
计算机视觉与模式识别
2025-04-08 v1 人工智能
摘要
基于深度神经网络的多模态3D目标检测确实取得了显著进展。然而,由于2D图像特征与3D点云特征之间的尺度和空间信息错位,仍面临挑战。现有方法通常在单一阶段聚合多模态特征。然而,利用多阶段跨模态特征对于检测各种尺度的目标至关重要。因此,这些方法往往难以有效集成不同尺度和模态间的特征,从而限制了检测精度。此外,常用的基于查询-键-值(QKV)的交叉注意力操作有助于通过捕获非局部上下文来推理目标的位置和存在性。然而,这种方法倾向于增加计算复杂度。为此,我们提出SSLFusion,一种 novel 的 Scale & Space Aligned Latent Fusion Model,包括尺度对齐融合策略(SAF)、3D到2D空间对齐模块(SAM)和潜在跨模态融合模块(LFM)。SAF通过在多个层次聚合图像和点云特征来缓解尺度错位。SAM通过将3D坐标信息纳入2D图像特征来减少图像和点云特征之间的模态差距。此外,LFM通过捕获潜在空间中的跨模态非局部上下文,实现了无需使用QKV注意力操作的跨模态融合,从而降低了计算复杂度。在KITTI和DENSE数据集上的实验表明,我们的SSLFusion在准确率上超过了当前最先进的方法。我们的 approach 在KITTI测试集中等难度级别下的3D AP上实现了绝对提升2.15%。
引用
@article{arxiv.2504.05170,
title = {SSLFusion: Scale & Space Aligned Latent Fusion Model for Multimodal 3D Object Detection},
author = {Bonan Ding and Jin Xie and Jing Nie and Jiale Cao},
journal= {arXiv preprint arXiv:2504.05170},
year = {2025}
}
备注
Accepted by AAAI 2025