MonoMM:一种用于实时单目3D目标检测的多尺度Mamba增强网络
计算机视觉与模式识别
2024-08-02 v1
摘要
基于转换器的单目3D目标检测技术最近取得了突出成果,表现出色于从单一2D图像推断3D属性。然而,大多数现有方法依赖资源密集型转换器体系结构,常导致在处理长序列数据时计算效率和性能显著下降。为解决这些挑战并推动单目3D目标检测技术的发展,我们提出了一种创新网络结构MonoMM,即面向实时单目3D目标检测的多尺度Mamba增强网络。该体系结构主要包括以下两个核心模块:Focused Multi-Scale Fusion(FMF)模块,旨在以较低的计算资源消耗有效保留和融合来自不同尺度的图像信息。通过精确调节信息流,FMF模块增强了模型对尺度变化的适应性和鲁棒性,同时保持图像细节。Depth-Aware Feature Enhancement Mamba(DMB)模块:它利用来自图像特征的融合特征作为输入,采用一种新颖的自适应策略全局整合深度信息和视觉信息。这种深度融合策略不仅提高了深度估计的准确性,也增强了模型在不同观察角度和环境条件下的性能。此外,MonoMM的模块化设计提供了高灵活性和可扩展性,便于根据特定应用需求进行调整和优化。在KITI数据集上进行的大量实验表明,我们的方法优于以前的单目方法,实现了实时检测。
引用
@article{arxiv.2408.00438,
title = {MonoMM: A Multi-scale Mamba-Enhanced Network for Real-time Monocular 3D Object Detection},
author = {Youjia Fu and Zihao Xu and Junsong Fu and Huixia Xue and Shuqiu Tan and Lei Li},
journal= {arXiv preprint arXiv:2408.00438},
year = {2024}
}