掩码感知的状态空间模型推理
计算机视觉与模式识别
2026-03-06 v1
摘要
许多真实世界的计算机视觉任务,如深度完成,必须处理输入中任意形状的缺失或无效区域。对于卷积神经网络 (CNN),部分卷积通过仅基于有效像素的掩码感知重新归一化来解决此问题。最近,像 Mamba 这样的状态空间模型 (SSM) 已涌现,具有高性能和线性复杂度。然而,这些架构缺乏在推理时处理此类任意形状无效数据的内在机制。为弥合这一差距,我们引入了部分视觉 Mamba (PVM),这是一种将部分操作原则移植到 Mamba 主干中的新型架构组件。我们还定义了一系列用于设计使用 PVM 的架构的规则。在深度完成、图像填充和带无效数据的分类任务中,我们展示了该方法的有效性和通用性。
引用
@article{arxiv.2603.04568,
title = {Mask-aware inference with State-Space Models},
author = {Ignasi Mas and Ramon Morros and Javier-Ruiz Hidalgo and Ivan Huerta},
journal= {arXiv preprint arXiv:2603.04568},
year = {2026}
}