LiteFusion:将基于视觉的3D目标检测拓展到多模态的轻量化方法
摘要
3D目标检测是实现安全和稳健智能交通系统的基本任务。当前的多模态3D目标检测器往往依赖复杂的体系结构和训练策略以实现更高的检测精度。然而,这些方法高度依赖LiDAR传感器,以至于在LiDAR缺失时表现会显著下降,这损害了自动化系统在实际场景下的鲁棒性和安全性。此外,现有的多模态检测器在部署到诸如NPU和FPGA等多样化硬件平台时面临困难,由于其依赖3D稀疏卷积运算,这些运算主要针对NVIDIA GPU进行优化。为此,我们重新考虑LiDAR在相机-LiDAR融合范式中的作用,提出一种新的多模态3D检测器LiteFusion。我们不将LiDAR点云作为独立的模态及其单独的特征提取主干,而是将LiDAR数据作为增强基于相机检测的几何信息的补充来源。这种简单直接的方法完全消除了对3D主干的依赖,使方法在部署友好性方面具有显著优势。具体而言,LiteFusion将LiDAR点云的互补特征整合到图像特征中,置于四元数空间,其中在网络训练期间保持正交约束。这有助于模型跨模态地捕获特定领域的关系,产生紧凑的跨模态嵌入。在nuScenes数据集上进行实验,结果表明LiteFusion在参数增加仅1.1%的情况下,将基线基于视觉的检测器的mAP提升了+20.4%,NDS提升了+19.7%。值得注意的是,即使没有LiDAR输入,LiteFusion也能保持出色的性能,凸显了其在各种融合范式和部署场景下的良好鲁棒性和有效性。
引用
@article{arxiv.2512.20216,
title = {Quantitative Financial Modeling for Sri Lankan Markets: Approach Combining NLP, Clustering and Time-Series Forecasting},
author = {Linuk Perera},
journal= {arXiv preprint arXiv:2512.20216},
year = {2025}
}
备注
08 Pages, 9 Figures, Published in the Proceedings of the 32'nd IET Sri Lanka Annual Technical Conference 2025 of the IET Sri Lanka Network; Second Runner Up Paper of the Conference