中文

TF-SSD:基于协同掩码过滤的无训练共显著目标检测强流水线

计算机视觉与模式识别 2026-04-02 v1

摘要

共显著目标检测(CoSOD)旨在分割在一组相关图像中一致出现的显著目标。尽管近期基于训练的方法取得了显著进展,但它们仍受限于封闭集数据集,且泛化能力有限。然而,很少有研究探索视觉基础模型(VFM)在解决CoSOD问题上的潜力,这些模型展现出强大的泛化能力和稳健的显著性理解。本文中,我们研究并利用VFM进行CoSOD,并进一步提出一种新颖的无训练方法TF-SSD,通过SAM与DINO之间的协同实现。具体而言,我们首先利用SAM生成全面的原始提议,作为候选掩码池。然后,我们引入一个质量掩码生成器来过滤冗余掩码,从而获得精炼的掩码集。由于该生成器基于SAM构建,其本质上缺乏对显著性的语义理解。为此,我们采用图像内显著性过滤器,利用DINO的注意力图来识别单个图像内视觉上显著的掩码。此外,为了将显著性理解扩展到组图像,我们提出一个图像间原型选择器,计算跨图像原型之间的相似度分数,以选择得分最高的掩码。这些选定的掩码作为CoSOD的最终预测。大量实验表明,我们的TF-SSD优于现有方法(例如,比近期无训练方法提升13.7%)。代码可在 https://github.com/hzz-yy/TF-SSD 获取。

关键词

引用

@article{arxiv.2604.00549,
  title  = {TF-SSD: A Strong Pipeline via Synergic Mask Filter for Training-free Co-salient Object Detection},
  author = {Zhijin He and Shuo Jin and Siyue Yu and Shuwei Wu and Bingfeng Zhang and Li Yu and Jimin Xiao},
  journal= {arXiv preprint arXiv:2604.00549},
  year   = {2026}
}

备注

Accepted by CVPR26