DiffCut: 利用扩散特征与递归归一化切割催化零样本语义分割
计算机视觉与模式识别
2025-10-03 v4
摘要
基础模型已成为语言、视觉和多模态任务等各个领域的强大工具。虽然先前的工作已经解决了无监督图像分割问题,但它们明显落后于监督模型。在本文中,我们使用扩散UNet编码器作为基础视觉编码器,并提出了DiffCut,一种无监督零样本分割方法,仅利用最终自注意力块的输出特征。通过大量实验,我们证明在基于图的分割算法中使用这些扩散特征,在零样本分割上显著优于先前的最先进方法。具体来说,我们利用递归归一化切割算法,该算法软调节检测对象的粒度,并产生精确定义的分割图,精确捕捉复杂的图像细节。我们的工作突出了扩散UNet编码器中嵌入的极其准确的语义知识,这些编码器随后可作为下游任务的基础视觉编码器。项目页面:https://diffcut-segmentation.github.io
引用
@article{arxiv.2406.02842,
title = {DiffCut: Catalyzing Zero-Shot Semantic Segmentation with Diffusion Features and Recursive Normalized Cut},
author = {Paul Couairon and Mustafa Shukor and Jean-Emmanuel Haugeard and Matthieu Cord and Nicolas Thome},
journal= {arXiv preprint arXiv:2406.02842},
year = {2025}
}
备注
NeurIPS 2024. Project page at https://diffcut-segmentation.github.io. Code at https://github.com/PaulCouairon/DiffCut