中文

基于图像信息去除的文本到图像编辑

计算机视觉与模式识别 2023-11-09 v2

摘要

扩散模型在文本引导的图像生成中已展现出令人印象深刻的性能。当前利用这些模型知识进行图像编辑的方法,要么使用输入图像对它们进行微调(例如 Imagic),要么将结构信息作为额外约束引入(例如 ControlNet)。然而,在单张图像上微调大规模扩散模型会导致严重的过拟合问题以及冗长的推理时间。预训练模型的信息泄漏也使得保留与文本输入无关的图像内容变得困难。此外,引入结构引导(例如边缘图、语义图、关键点)的方法难以保留颜色和纹理等属性。使用输入图像作为控制可缓解这些问题,但由于这些模型通过重建进行训练,模型在将原始图像编码时可能简单地隐藏其信息以完美重建图像,而不学习编辑任务。为应对这些挑战,我们提出了一种带有图像信息去除模块(IIR)的文本到图像编辑模型,该模块有选择地擦除原始图像中与颜色和纹理相关的信息,从而更好地保留与文本无关的内容,并避免由信息隐藏引起的问题。我们在 CUB、Outdoor Scenes 和 COCO 上的实验表明,我们的方法实现了最佳的编辑性-保真度权衡结果。此外,在 COCO 上的用户研究表明,我们的编辑图像比先前工作更受偏好,超出 35%。

关键词

引用

@article{arxiv.2305.17489,
  title  = {Text-to-image Editing by Image Information Removal},
  author = {Zhongping Zhang and Jian Zheng and Jacob Zhiyuan Fang and Bryan A. Plummer},
  journal= {arXiv preprint arXiv:2305.17489},
  year   = {2023}
}

备注

Full paper is accepted by WACV2024; Best paper runner-up of AI4CC@CVPR 2023