中文

MSSSeg:学习多尺度结构复杂度用于自监督分割

计算机视觉与模式识别 2026-03-17 v2

摘要

自监督语义分割方法通常会出现结构错误,包括合并不同的对象或碎裂连贯的区域,因为它们主要依赖诸如颜色和纹理等低层外观线索。这些线索缺乏结构区分性:它们不携带有关区域结构组织的信息,使得难以区分外观相似对象之间的边界或保持内部变化区域的一致性。最近的方法试图通过引入深度先验来解决此问题,但仍然受限于未对即使外观线索模糊时依然存在的结构复杂度进行显式建模。为了弥合这一差距,我们提出了 MSSSeg,这是一个通过三个耦合组件从语义和深度域中显式学习多尺度结构复杂度的框架:(1) 可微分盒计数 (DBC) 模块,捕获多尺度结构复杂度特征并将其与语义特征对齐;(2) 可学习结构增强 (StructAug),破坏像素强度模式,迫使网络依赖来自 DBC 的结构复杂度特征;(3) 持续同调损失 (PHLoss),直接监督预测分割的结构复杂度。大量实验表明,MSSSeg 在 COCO-Stuff-27、Cityscapes 和 Potsdam 上取得了新的 state-of-the-art 性能,且没有过高的计算开销,验证了显式结构复杂度学习对于自监督分割至关重要。

关键词

引用

@article{arxiv.2512.23997,
  title  = {MSSSeg: Learning Multi-Scale Structural Complexity for Self-Supervised Segmentation},
  author = {Haotang Li and Zhenyu Qi and Hao Qin and Huanrui Yang and Kebin Peng and Qing Guo and Sen He},
  journal= {arXiv preprint arXiv:2512.23997},
  year   = {2026}
}