利用稳定扩散的无监督语义对应
计算机视觉与模式识别
2023-12-29 v2
摘要
文本到图像扩散模型现已能生成常与真实图像难以区分的图像。为生成此类图像,这些模型必须理解其所生成物体的语义。本工作中我们表明,无需任何训练,即可利用扩散模型内的这一语义知识来寻找语义对应——即多幅图像中具有相同语义含义的位置。具体而言,给定一幅图像,我们优化这些模型的提示嵌入,使其对感兴趣区域具有最大注意力。这些优化后的嵌入捕获了关于该位置的语义信息,随后可迁移至另一幅图像。由此,我们在 PF-Willow 数据集上取得了与强监督最优方法相当的结果,并在 PF-Willow、CUB-200 和 SPair-71k 数据集上显著优于(SPair-71k 数据集相对提升 20.9%)任何已有的弱监督或无监督方法。
引用
@article{arxiv.2305.15581,
title = {Unsupervised Semantic Correspondence Using Stable Diffusion},
author = {Eric Hedlin and Gopal Sharma and Shweta Mahajan and Hossam Isack and Abhishek Kar and Andrea Tagliasacchi and Kwang Moo Yi},
journal= {arXiv preprint arXiv:2305.15581},
year = {2023}
}
备注
Project website: https://github.com/ubc-vision/LDM_correspondences