MambaSeg:利用Mamba实现精确高效的图像-事件语义分割
计算机视觉与模式识别
2026-01-01 v1
摘要
语义分割是计算机视觉中的一项基本任务,广泛应用于自动驾驶和机器人等领域。虽然基于RGB的方法利用CNN和Transformer取得了强大的性能,但由于传统帧相机的局限性,在快速运动、低光照或高动态范围条件下,其效果会下降。事件相机提供了高时间分辨率和低延迟等互补优势,但缺乏颜色和纹理信息,使其自身不足以完成任务。为解决此问题,近期研究探索了RGB与事件数据的多模态融合;然而,许多现有方法计算成本高昂,且主要关注空间融合,忽略了事件流中固有的时间动态特性。在本工作中,我们提出了MambaSeg,一种新颖的双分支语义分割框架,它采用并行的Mamba编码器来高效地建模RGB图像和事件流。为减少跨模态歧义,我们引入了双维交互模块(DDIM),该模块包含一个跨空间交互模块(CSIM)和一个跨时间交互模块(CTIM),它们共同沿空间和时间维度执行细粒度融合。此设计改善了跨模态对齐,减少了歧义,并利用了每种模态的互补特性。在DDD17和DSEC数据集上的大量实验表明,MambaSeg在显著降低计算成本的同时,实现了最先进的分割性能,展示了其在高效、可扩展和鲁棒的多模态感知方面的潜力。
引用
@article{arxiv.2512.24243,
title = {MambaSeg: Harnessing Mamba for Accurate and Efficient Image-Event Semantic Segmentation},
author = {Fuqiang Gu and Yuanke Li and Xianlei Long and Kangping Ji and Chao Chen and Qingyi Gu and Zhenliang Ni},
journal= {arXiv preprint arXiv:2512.24243},
year = {2026}
}
备注
Accepted by AAAI 2026