中文

TF-ICON:基于扩散模型的无训练跨域图像合成

计算机视觉与模式识别 2023-10-11 v4 人工智能

摘要

文本驱动的扩散模型已展现出令人惊叹的生成能力,支持多种图像编辑任务。本文中,我们提出TF-ICON,一种新颖的无训练图像合成(Image COmpositioN)框架,利用文本驱动扩散模型实现跨域图像引导合成。该任务旨在将用户提供的对象无缝集成到特定视觉上下文中。当前基于扩散的方法常涉及昂贵的基于实例的优化或在定制数据集上微调预训练模型,这可能削弱其丰富的先验。相比之下,TF-ICON可利用现成扩散模型执行跨域图像引导合成,无需额外训练、微调或优化。此外,我们引入不含任何信息的特殊提示(exceptional prompt),以辅助文本驱动扩散模型将真实图像准确反演为潜表示,构成合成基础。实验表明,为Stable Diffusion配备特殊提示在多个数据集(CelebA-HQ、COCO和ImageNet)上优于最先进反演方法,且TF-ICON在多种视觉域中超越先前基线。代码见 https://github.com/Shilin-LU/TF-ICON

关键词

引用

@article{arxiv.2307.12493,
  title  = {TF-ICON: Diffusion-Based Training-Free Cross-Domain Image Composition},
  author = {Shilin Lu and Yanzhu Liu and Adams Wai-Kin Kong},
  journal= {arXiv preprint arXiv:2307.12493},
  year   = {2023}
}

备注

Accepted by ICCV 2023