中文

文本到图像扩散模型是出色的草图 - 照片匹配器

计算机视觉与模式识别 2024-03-22 v2

摘要

本文首次探索了用于零样本基于草图的图像检索 (ZS-SBIR) 的文本到图像扩散模型。我们强调了一个关键发现:文本到图像扩散模型能够无缝弥合草图与照片之间的差距。这种能力源于其强大的跨模态能力和形状偏好,这些发现已通过我们的初步研究得到证实。为了有效利用预训练的扩散模型,我们引入了一种简单而强大的策略,专注于两个关键方面:选择最优特征层以及利用视觉和文本提示。对于前者,我们确定了哪些层富含信息且最适合特定的检索需求(类别级或细粒度)。然后,我们采用视觉和文本提示来引导模型的特征提取过程,使其能够生成更具判别力且上下文相关的跨模态表示。在多个基准数据集上的广泛实验验证了显著的性能提升。

关键词

引用

@article{arxiv.2403.07214,
  title  = {Text-to-Image Diffusion Models are Great Sketch-Photo Matchmakers},
  author = {Subhadeep Koley and Ayan Kumar Bhunia and Aneeshan Sain and Pinaki Nath Chowdhury and Tao Xiang and Yi-Zhe Song},
  journal= {arXiv preprint arXiv:2403.07214},
  year   = {2024}
}

备注

Accepted in CVPR 2024. Project page available at https://subhadeepkoley.github.io/DiffusionZSSBIR