KNN-Diffusion:基于大规模检索的图像生成
计算机视觉与模式识别
2022-10-04 v2 人工智能
计算与语言
图形学
机器学习
摘要
近期的文本到图像模型已取得令人印象深刻的成果。然而,由于它们需要大规模文本-图像对数据集,在新领域数据稀缺或无标注时训练它们并不现实。本工作中,我们提出使用大规模检索方法,特别是高效的 k-最近邻(kNN),其提供了新能力:(1)无需任何文本训练一个显著更小且高效的文本到图像扩散模型;(2)通过在推理时简单替换检索数据库生成分布外图像;(3)在执行文本驱动的局部语义操控的同时保持对象身份。为证明我们方法的鲁棒性,我们将 kNN 方法应用于两个最先进的扩散骨干网络,并展示在多个不同数据集上的结果。根据人类研究与自动指标评估,相较现有仅使用图像(无配对文本数据)训练文本到图像生成模型的方法,我们的方法取得了最先进(SOTA)结果。
引用
@article{arxiv.2204.02849,
title = {KNN-Diffusion: Image Generation via Large-Scale Retrieval},
author = {Shelly Sheynin and Oron Ashual and Adam Polyak and Uriel Singer and Oran Gafni and Eliya Nachmani and Yaniv Taigman},
journal= {arXiv preprint arXiv:2204.02849},
year = {2022}
}