扩散、注意力与分割: 基于Stable Diffusion的无监督零样本分割
计算机视觉与模式识别
2024-04-03 v3
摘要
为图像生成高质量分割掩码是计算机视觉中的基本问题。近期研究探索了大规模监督训练以在几乎任意图像风格上实现零样本分割,以及无监督训练以在无密集标注情况下实现分割。然而,构建一个能够以零样本方式分割任意事物且无需任何标注的模型仍具挑战性。在本文中,我们提出利用稳定扩散模型中的自注意力层来实现此目标,因为预训练的稳定扩散模型已在其注意力层中学习了物体的固有概念。具体而言,我们引入了一个简单而有效的基于测量注意力图间KL散度进行迭代合并的过程,以将其合并为有效分割掩码。所提方法不需要任何训练或语言依赖即可为任意图像提取高质量分割。在COCO-Stuff-27上,我们的方法在像素精度上绝对超越先前无监督零样本SOTA方法26%,在平均IoU上超越17%。项目页面位于\url{https://sites.google.com/view/diffseg/home}。
引用
@article{arxiv.2308.12469,
title = {Diffuse, Attend, and Segment: Unsupervised Zero-Shot Segmentation using Stable Diffusion},
author = {Junjiao Tian and Lavisha Aggarwal and Andrea Colaco and Zsolt Kira and Mar Gonzalez-Franco},
journal= {arXiv preprint arXiv:2308.12469},
year = {2024}
}
备注
Accepted to CVPR2024