中文

视频语义分割状态空间模型中被遗忘特定细节的细化:RS-SSM方法

计算机视觉与模式识别 2026-03-27 v2

摘要

最近,状态空间模型在视频语义分割中展现出通过线性复杂度状态空间压缩实现的高效性能。然而,视频语义分割(VSS)需要像素级别的时空建模能力以维持语义对象的分割temporal一致性。虽然状态空间模型可在状态空间压缩期间保留常见语义信息,但固定大小的状态空间不可避免地遗忘了特定信息,这限制了模型在像素级别分割方面的能力。为解决上述问题,我们提出了针对视频语义分割的细化被遗忘特定细节的状态空间模型方法(RS-SSM),其对被遗忘的时空特定细节进行互补细化。具体而言,设计了通道幅度感知器(CwAP)用于提取和对齐状态空间中特定信息的分布特征。此外,提出了遗忘门信息细化器(FGIR)以基于特定信息分布自适应地反转并细化状态空间模型中的遗忘门矩阵。因此,RS-SSM利用反转遗忘门对状态空间压缩期间被遗忘的特定信息进行互补细化,从而提升了模型在时空像素级别分割方面的能力。在四个VSS基准测试上进行了大量实验,表明RS-SSM在保持高计算效率的同时实现了最先进的性能。代码已公开:https://github.com/zhoujiahuan1991/CVPR2026-RS-SSM。

关键词

引用

@article{arxiv.2603.24295,
  title  = {RS-SSM: Refining Forgotten Specifics in State Space Model for Video Semantic Segmentation},
  author = {Kai Zhu and Zhenyu Cui and Zehua Zang and Jiahuan Zhou},
  journal= {arXiv preprint arXiv:2603.24295},
  year   = {2026}
}

备注

Accepted by CVPR 2026