中文

SINE:基于文本到图像扩散模型的单图像编辑

计算机视觉与模式识别 2025-04-01 v2 人工智能

摘要

近期关于扩散模型的工作已展示出对图像生成进行条件控制的强大能力,例如文本引导的图像合成。此类成功激励了许多尝试使用大规模预训练扩散模型来解决一个具有挑战性的问题——真实图像编辑。该领域的工作学习一个对应于包含同一对象的若干图像的唯一文本标记。然而,在许多情况下,仅有一张图像可用,例如《戴珍珠耳环的少女》的画作。使用现有工作在单张图像上微调预训练扩散模型会导致严重的过拟合问题。来自预训练扩散模型的信息泄漏使得编辑无法在保持与给定图像相同内容的同时创建由语言引导所描绘的新特征。本工作旨在解决单图像编辑问题。我们提出了一种基于无分类器引导构建的新颖基于模型的引导,使得在单张图像上训练的模型的知识可以蒸馏到预训练扩散模型中,从而即使仅给定一张图像也能实现内容创作。此外,我们提出了一种基于块(patch)的微调,可有效帮助模型生成任意分辨率的图像。我们提供了大量实验来验证我们方法的设计选择,并展示了有前景的编辑能力,包括改变风格、内容添加和对象操控。代码已发布于 https://github.com/zhang-zx/SINE.git 供研究使用。

关键词

引用

@article{arxiv.2212.04489,
  title  = {SINE: SINgle Image Editing with Text-to-Image Diffusion Models},
  author = {Zhixing Zhang and Ligong Han and Arnab Ghosh and Dimitris Metaxas and Jian Ren},
  journal= {arXiv preprint arXiv:2212.04489},
  year   = {2025}
}

备注

Accepted at CVPR 2023. Project website: https://zhang-zx.github.io/SINE/