SeeDiff:基于扩散模型的即插即用种子掩码生成
计算机视觉与模式识别
2025-09-16 v2
摘要
语义分割网络被赋予像素级对象分类任务,需大量人工标注掩码。为获取特定类别的像素级标注掩码而无需人工劳动,近期方法尝试通过图像-文本关系模型(尤其是 Stable Diffusion)构建图像与标注掩码的配对。然而,这些方法未充分发挥文本引导扩散模型的能力,故需预训练分割网络、精细调优文本提示,或训练分割网络以生成最终标注掩码。本文深入分析 Stable Diffusion 的注意力机制,发现其与经典种子分割方法的关联。具体而言,交叉注意力仅能提供粗略的对象局部分辨,但可作为初始种子。类似种子分割中的区域扩张,我们利用自注意力的语义对应建模能力,通过多尺度自注意力图从种子逐步扩散至整个类别。我们也观察到,简单文本引导的合成图像常具有统一背景,而复杂结构对象则较难建立对应。因此,我们进一步利用更精确的背景掩码对掩码进行细化。所提方法即 SeeDiff,无需额外训练、提示调优或预训练分割网络,即可从 Stable Diffusion 中生成高质量掩码。
引用
@article{arxiv.2507.19808,
title = {SeeDiff: Off-the-Shelf Seeded Mask Generation from Diffusion Models},
author = {Joon Hyun Park and Kumju Jo and Sungyong Baik},
journal= {arXiv preprint arXiv:2507.19808},
year = {2025}
}
备注
AAAI 2025