LIDAR:面向结构裂缝的轻量级自适应 cue-aware 融合视觉 Mamba 网络
计算机视觉与模式识别
2025-08-01 v2 人工智能
摘要
使用多模态数据以低计算成本实现像素级分割仍是裂缝分割任务中的关键挑战。现有方法缺乏自适应感知和跨模态特征高效交互融合的能力。为此,我们提出了轻量级自适应 cue-aware 视觉 Mamba 网络(LIDAR),有效感知和整合多模态场景下形貌和纹理线索,生成清晰的像素级裂缝分割图。具体而言,LIDAR 由轻量级自适应 cue-aware 视觉状态空间模块(LacaVSS)和轻量级双域动态协作融合模块(LD3CF)组成。LacaVSS 通过提出的基于掩码引导的高效动态引导扫描策略(EDG-SS)自适应建模裂缝线索,而 LD3CF 利用自适应频域感知器(AFDP)和双池化融合策略有效捕获跨模态的空间与频域线索。此外,我们设计了轻量级动态调制多核卷积(LDMK),以最小计算开销感知复杂的形貌结构,取代 LIDAR 中的大部分卷积操作。在三个数据集上的实验表明,我们的方法在其他最先进(SOTA)方法中表现优异。在光场深度数据集上,本方法仅使用 535 万参数即可实现 F1 为 0.8204,mIoU 为 0.8465。代码和数据集已提供于 https://github.com/Karl1109/LIDAR-Mamba。
引用
@article{arxiv.2507.22477,
title = {LIDAR: Lightweight Adaptive Cue-Aware Fusion Vision Mamba for Multimodal Segmentation of Structural Cracks},
author = {Hui Liu and Chen Jia and Fan Shi and Xu Cheng and Mengfei Shi and Xia Xie and Shengyong Chen},
journal= {arXiv preprint arXiv:2507.22477},
year = {2025}
}
备注
This paper has been accepted by ACM MM 2025