中文

EmambaIR:面向事件导引图像重建的高效视觉状态空间模型

计算机视觉与模式识别 2026-05-11 v1 人工智能

摘要

近期的基于事件的图像重建方法主要依赖卷积神经网络(CNN)和视觉转换器(ViT)来处理互补的事件信息。然而,这些架构面临根本性限制:CNN 往往难以捕获全局特征关联,而 ViT 则因其平方计算复杂度(如 O(n2)O(n^2))而在高分辨率场景中受限。为此,我们引入 EmambaIR,这是一个用于利用空间稀疏且时间连续事件流进行图像重建的高效视觉状态空间模型。我们的框架包含两个关键组件:跨模态 Top-k 稀疏注意力模块(TSAM)和门控状态空间模块(GSSM)。TSAM 高效地对像素级 Top-k 稀疏注意力进行指导,以实现跨模态交互,产生富含信息却稀疏的融合特征。随后,GSSM 利用非线性门控单元增强原始线性复杂度(O(n)O(n))状态空间模型的时序表示,有效捕获全局语境依赖关系,又无需通常的计算开销。在六个数据集上的大量实验表明,EmambaIR 在三种多样化的图像重建任务——运动模糊去除、雨景去除和高动态范围(HDR)增强——中显著优于最先进的方法,同时在内存消耗和计算成本方面实现了显著的降低。源代码和数据已公开发布于:https://github.com/YunhangWickert/EmambaIR

关键词

引用

@article{arxiv.2605.08073,
  title  = {EmambaIR: Efficient Visual State Space Model for Event-guided Image Reconstruction},
  author = {Wei Yu and Yunhang Qian},
  journal= {arXiv preprint arXiv:2605.08073},
  year   = {2026}
}