CMF-IoU:基于多阶段跨模态融合的 3D 目标检测
计算机视觉与模式识别
2025-08-19 v1
摘要
基于摄像机和 LiDAR 传感器的多模态方法在 3D 检测领域受到广泛关注。然而,许多主流作品仅关注单一或部分阶段融合,导致特征提取不足和性能次优。本文引入一种多阶段跨模态融合 3D 检测框架,称为 CMF-IOU,以有效解决 3D 空间信息与 2D 语义信息对齐的挑战。具体而言,我们首先通过深度完成网络将像素信息投影到 3D 空间以获取伪点(pseudo points),从而统一 LiDAR 与摄像机信息的表征。随后,设计了双向跨视角增强 3D 主干网络,用于编码 LiDAR 点云和伪点。第一个稀疏到远(sparse-to-distant, S2D)分支采用编码器-解码器结构强化稀疏 LiDAR 点的表征。第二个残差视角一致性(residual view consistency, ResVC)分支通过 3D 与 2D 卷积过程来缓解不准确伪点的影响。随后,我们引入一种迭代体素-点感知的细粒度池化模块,在提案细化阶段捕获来自 LiDAR 点的空间信息和来自伪点的纹理信息。为实现迭代中的更精细细化,设计了一个集成新提案生成技术的 IoU 联合预测分支,以保留具有高 IoU 与高分类得分的边界框。大量实验表明,我们的方法在 KITTI、nuScenes 和 Waymo 数据集上表现出优异性能。
引用
@article{arxiv.2508.12917,
title = {CMF-IoU: Multi-Stage Cross-Modal Fusion 3D Object Detection with IoU Joint Prediction},
author = {Zhiwei Ning and Zhaojiang Liu and Xuanang Gao and Yifan Zuo and Jie Yang and Yuming Fang and Wei Liu},
journal= {arXiv preprint arXiv:2508.12917},
year = {2025}
}
备注
The Paper is Accepted by TCSVT