中文

双特征记:Stable Diffusion补充DINO用于零样本语义对应

计算机视觉与模式识别 2023-11-29 v2

摘要

文本到图像扩散模型在生成和编辑高质量图像方面取得了显著进展。因此,众多方法探索了扩散模型特征理解和处理单张图像以用于下游任务(如分类、语义分割和风格化)的能力。然而,关于这些特征在多个不同图像和物体之间揭示了什么,人们的了解则少得多。在本工作中,我们利用Stable Diffusion(SD)特征进行语义与稠密对应,并发现经过简单后处理,SD特征在量化上可与SOTA表征相似。有趣的是,定性分析揭示SD特征与现有表征学习特征(如最近发布的DINOv2)具有非常不同的性质:DINOv2提供稀疏但准确的匹配,而SD特征提供高质量空间信息但有时语义匹配不准确。我们展示了这两种特征的简单融合出奇地有效,并且基于这些融合特征使用最近邻的零样本评估在基准数据集(如SPair-71k、PF-Pascal和TSS)上相比最先进方法提供了显著的性能提升。我们还展示了这些对应能够支持有趣的应用,例如两幅图像中的实例交换。

关键词

引用

@article{arxiv.2305.15347,
  title  = {A Tale of Two Features: Stable Diffusion Complements DINO for Zero-Shot Semantic Correspondence},
  author = {Junyi Zhang and Charles Herrmann and Junhwa Hur and Luisa Polania Cabrera and Varun Jampani and Deqing Sun and Ming-Hsuan Yang},
  journal= {arXiv preprint arXiv:2305.15347},
  year   = {2023}
}

备注

Accepted by NeurIPS 23, project page: https://sd-complements-dino.github.io/