释放扩散模型在零样本语义分割中的潜能
计算机视觉与模式识别
2024-10-30 v3
摘要
扩散模型不仅在图像生成领域取得了显著成就,也显示出作为有效预训练方法利用无标签数据的数据的潜力。鉴于扩散模型在语义对应和开放词汇分割中所展现的广泛潜能,我们开展了将潜在扩散模型用于零样本语义分割的调查工作。最近受大型语言模型内在学习能力启发,零样本语义分割演变为内在语义分割任务,成为评估通用分割模型的关键指标。在此背景下,我们聚焦于零样本语义分割,为未来基于扩散模型的分割通用模型开发奠定了坚实的基础。我们的初始工作聚焦于理解如何促进查询图像与支持图像之间的交互,提出了在自注意力框架内进行 KV 融合的方法。随后,我们深入研究了如何优化来自支持掩码的信息摄入,同时重新评估如何为查询掩码提供合理的监督。基于我们的分析,我们构建了一个简单且高效的框架,命名为 DiffewS,最大限地保留了原始潜在扩散模型的生成框架,有效利用预训练先验。实验结果表明,我们的方法在多个设置下显著优于以往的 SOTA 模型。
引用
@article{arxiv.2410.02369,
title = {Unleashing the Potential of the Diffusion Model in Few-shot Semantic Segmentation},
author = {Muzhi Zhu and Yang Liu and Zekai Luo and Chenchen Jing and Hao Chen and Guangkai Xu and Xinlong Wang and Chunhua Shen},
journal= {arXiv preprint arXiv:2410.02369},
year = {2024}
}
备注
Accepted to Proc. Annual Conference on Neural Information Processing Systems (NeurIPS) 2024. Webpage: https://github.com/aim-uofa/DiffewS