基于双聚类和最优传输对齐的无标注显著物体检测
计算机视觉与模式识别
2025-10-21 v1
摘要
显著物体检测(SOD)旨在分割图像中的视觉突出区域,作为各种计算机视觉应用的基础任务。我们认为,在仅获得可靠伪掩码而无需单个像素级标签的情况下,SOD 现在可以接近无监督准确度。我们重新审视了基于原型的方法,提出了两个关键观察:首先,边界像素和内部像素遵循显著不同的几何形状;其次,若原型质量较弱,最优传输(OT)强制的全局一致性被低估。为此,我们引入POTNet,这是一种Prototypical Optimal Transport 的改进方案,将 POT 的单次 k 均值聚类替换为由熵导引的双聚类头:高熵像素按谱聚类组织,低熵像素按 k 均值组织,两个原型集合随后通过 OT 对齐。这种 split-fuse-transport 设计在单次前向传播中生成更锐利、具有部分感知能力的伪掩码,无需手工先验。这些掩码监督标准的 MaskFormer 风格编码器-解码器,形成AutoSOD,这是一条消除SelfMask离线投票却提升准确度和训练效率的端到端无监督SOD管道。广泛的实验表明,AutoSOD 在F分数上比无监督方法提升最高可达26%,比弱监督方法提升最高可达36%,进一步缩小了与完全监督模型之间的差距。
引用
@article{arxiv.2510.17484,
title = {Split-Fuse-Transport: Annotation-Free Saliency via Dual Clustering and Optimal Transport Alignment},
author = {Muhammad Umer Ramzan and Ali Zia and Abdelwahed Khamis and Noman Ali and Usman Ali and Wei Xiang},
journal= {arXiv preprint arXiv:2510.17484},
year = {2025}
}