扩散模型实为无需训练的开放词汇语义分割器
计算机视觉与模式识别
2024-01-23 v3
摘要
预训练的文本-图像判别模型(如 CLIP)已被探索用于开放词汇语义分割,但因丢失关键定位信息及物体形状感知而结果不尽人意。近来,将生成模型从生成任务拓展至语义分割的兴趣渐增。这些方法利用生成模型生成标注数据或提取特征以辅助语义分割,通常需生成大量合成数据或额外掩码标注。为此,我们揭示了生成式文本到图像扩散模型(如 Stable Diffusion)作为高效开放词汇语义分割器的潜力,并引入一种名为 DiffSegmenter 的免训练新方法。其洞见在于:为生成与输入文本语义忠实一致的逼真物体,扩散模型隐式学习了完整物体形状与相应语义。我们发现物体形状由去噪 U-Net 产生的自注意力图刻画,而语义由交叉注意力图指示,这构成了我们分割结果的基础。此外,我们精心设计了有效的文本提示与类别过滤机制以进一步增强分割结果。在三个基准数据集上的大量实验表明,所提 DiffSegmenter 在开放词汇语义分割上取得了令人印象深刻的成果。
引用
@article{arxiv.2309.02773,
title = {Diffusion Model is Secretly a Training-free Open Vocabulary Semantic Segmenter},
author = {Jinglong Wang and Xiawei Li and Jing Zhang and Qingyuan Xu and Qin Zhou and Qian Yu and Lu Sheng and Dong Xu},
journal= {arXiv preprint arXiv:2309.02773},
year = {2024}
}