中文

基于事件-图像融合的鲁棒语义分割:EIFNet 框架

计算机视觉与模式识别 2025-07-30 v1

摘要

基于事件的语义分割探索了事件相机的潜力,这些相机拥有高动态范围和细微的时间分辨率,以实现对具有挑战性环境的稳健场景理解。尽管存在这些优势,但该任务仍然面临两个主要挑战:从稀疏且嘈杂的事件流中提取可靠特征,以及有效地融合结构和表示形式不同的稠密、语义丰富的图像数据。为此,我们提出了 EIFNet,一种多模态融合网络,将事件和帧式输入的优势相结合。该网络包括一个自适应事件特征细化模块(AEFRM),通过多尺度活动建模和空间注意力来提高事件表示。在此基础上,我们引入了一个模态自适应再校准模块(MARM)和一个多头注意力门控融合模块(MGFM),使用注意力机制和门控融合策略对跨模态的特征进行对齐和集成。在 DDD17-Semantic 和 DSEC-Semantic 数据集上的实验表明,EIFNet 实现了最先进的性能,展示了其在事件-based 语义分割中的有效性。

关键词

引用

@article{arxiv.2507.21971,
  title  = {EIFNet: Leveraging Event-Image Fusion for Robust Semantic Segmentation},
  author = {Zhijiang Li and Haoran He},
  journal= {arXiv preprint arXiv:2507.21971},
  year   = {2025}
}