中文

面向非模态实例分割的遮挡几何引导注入可学习形状原型

计算机视觉与模式识别 2026-05-26 v1

摘要

非模态实例分割旨在预测完整的物体掩码,包括缺乏像素级观测且必须借助形状先验推断的遮挡区域。现有方法通过固定容量的编码空间或昂贵的生成模型获取形状先验,并将其均匀注入所有空间位置,而未适应可见区域与遮挡区域之间不同的先验需求。在本文中,我们提出了一种门控可靠性自适应形状先验框架,该框架引入了一个形状先验记忆模块,通过交叉注意力组合可学习的原型,以加权原型组合而非生成的方式产生实例自适应的形状先验。然后,一个空间自适应可靠性门利用可见掩码的有符号距离场,根据每个位置的遮挡深度来调制注入强度,在保留可见区域可靠特征的同时,将形状补偿导向遮挡区域。在两个主流非模态实例分割基准上的实验表明,所提出的方法在多种评估设置下均优于现有方法,在标准设置下,其中一个基准的遮挡区域平均交并比提升了超过 11 个百分点,而总参数量仅约为三分之一。线性探测分析进一步揭示,可见掩码交叉注意力模块隐式地将遮挡几何编码到视觉 token 表示中,从而解释了所提出模块分解的有效性。

关键词

引用

@article{arxiv.2605.24533,
  title  = {Learnable Shape Prototypes with Occlusion-Geometry-Guided Injection for Amodal Instance Segmentation},
  author = {Fufan Zhang and Jingxiang Wang and Xiangjie Ye},
  journal= {arXiv preprint arXiv:2605.24533},
  year   = {2026}
}

备注

13 pages, 7 figures, 5 tables. Submitted to IEEE Transactions on Circuits and Systems for Video Technology