基于前景感知的 Slot 注意力与伪掩码引导的无监督结构场景分解
计算机视觉与模式识别
2025-12-11 v2
摘要
最新进展显示,基于 slot 注意力的方法在无监督的情况下能够有效地将视觉场景分解为物体 slot 表示。然而,现有方法通常不区分前景和背景区域,导致背景干扰以及在真实数据上的实例发现性能不佳。为此,我们提出了前景感知型 Slot 注意力 (Foreground-Aware Slot Attention, FASA),是一个两阶段框架,显式地将前景与背景分离,以实现精确的物体发现。在第一阶段,FASA 通过双 slot 竞争机制进行粗略的场景分解,以区分前景和背景区域。这些 slot 通过基于聚类的策略初始化,得到结构良好的表示,代表突出区域。在第二阶段,我们引入掩码 slot 注意力机制,其中第一个 slot 捕获背景,而其余 slot 竞争表示 individual 前景对象。为进一步解决前景对象的过分割问题,我们融合源自基于自监督图像特征构建的 patch affinity 图的伪掩码引导,指导前景 slot 的学习。在合成数据和真实数据上的大量实验表明,FASA 持续地优于最先进的方法,验证了显式前景建模和伪掩码引导对于稳健场景分解和物体一致表示的有效性。代码将公开发布。
引用
@article{arxiv.2512.02685,
title = {Unsupervised Structural Scene Decomposition via Foreground-Aware Slot Attention with Pseudo-Mask Guidance},
author = {Huankun Sheng and Ming Li and Yixiang Wei and Yeying Fan and Yu-Hui Wen and Tieliang Gong and Yong-Jin Liu},
journal= {arXiv preprint arXiv:2512.02685},
year = {2025}
}