中文

掩码感知的状态空间模型推理

计算机视觉与模式识别 2026-03-06 v1

摘要

许多真实世界的计算机视觉任务,如深度完成,必须处理输入中任意形状的缺失或无效区域。对于卷积神经网络 (CNN),部分卷积通过仅基于有效像素的掩码感知重新归一化来解决此问题。最近,像 Mamba 这样的状态空间模型 (SSM) 已涌现,具有高性能和线性复杂度。然而,这些架构缺乏在推理时处理此类任意形状无效数据的内在机制。为弥合这一差距,我们引入了部分视觉 Mamba (PVM),这是一种将部分操作原则移植到 Mamba 主干中的新型架构组件。我们还定义了一系列用于设计使用 PVM 的架构的规则。在深度完成、图像填充和带无效数据的分类任务中,我们展示了该方法的有效性和通用性。

关键词

引用

@article{arxiv.2603.04568,
  title  = {Mask-aware inference with State-Space Models},
  author = {Ignasi Mas and Ramon Morros and Javier-Ruiz Hidalgo and Ivan Huerta},
  journal= {arXiv preprint arXiv:2603.04568},
  year   = {2026}
}