中文

CompoDiff:基于隐扩散的多功能组合图像检索

计算机视觉与模式识别 2024-07-17 v4 信息检索

摘要

本文提出一种基于扩散的新模型CompoDiff,利用隐扩散解决零样本组合图像检索(ZS-CIR)。本文还引入一个名为SynthTriplets18M的新合成数据集,包含1880万参考图像、条件及对应目标图像三元组,用于训练CIR模型。CompoDiff与SynthTriplets18M解决了先前CIR方法的不足,如数据集规模小与条件类型有限导致的泛化性差。CompoDiff不仅在包括FashionIQ、CIRR、CIRCO与GeneCIS的四个ZS-CIR基准上取得新的最优性能,还可通过接受多种条件(如负文本与图像掩码条件)实现更具多功能性与可控性的CIR。CompoDiff还展示了文本与图像查询间条件强度的可控性,以及推理速度与性能间的权衡,这些是现有CIR方法所不具备的。代码与数据集可在https://github.com/navervision/CompoDiff获取。

关键词

引用

@article{arxiv.2303.11916,
  title  = {CompoDiff: Versatile Composed Image Retrieval With Latent Diffusion},
  author = {Geonmo Gu and Sanghyuk Chun and Wonjae Kim and HeeJae Jun and Yoohoon Kang and Sangdoo Yun},
  journal= {arXiv preprint arXiv:2303.11916},
  year   = {2024}
}

备注

TMLR camera-ready; First two authors contributed equally; TMLR Expert Certification; 30 pages, 5.9MB