中文

UniTune:通过在单张图像上微调扩散模型实现文本驱动图像编辑

计算机视觉与模式识别 2023-07-06 v4 图形学 机器学习

摘要

文本驱动的图像生成方法近来取得了令人印象深刻的成果,使普通用户能够通过提供文本描述生成高质量图像。然而,用于编辑现有图像的类似能力仍难以实现。文本驱动的图像编辑方法通常需要编辑掩码,难以处理需要显著视觉变化的编辑,且无法轻易保留被编辑部分的特定细节。在本文中我们观察到,图像生成模型只需在单张图像上微调即可转化为图像编辑模型。我们还表明,在采样前用基础图像的加噪版本初始化随机采样器,并在采样后从基础图像插值相关细节,可进一步提升编辑操作的质量。结合这些观察,我们提出 UniTune,一种新颖的图像编辑方法。UniTune 以任意图像和文本编辑描述为输入,在执行编辑的同时保持对输入图像的高保真度。UniTune 不需要额外输入(如掩码或草图),且可在同一图像上执行多次编辑而无需重新训练。我们使用 Imagen 模型在一系列不同用例中测试了我们的方法。我们证明其具有广泛适用性,并能执行范围惊人广泛的富有表现力的编辑操作,包括那些需要显著视觉变化、此前无法实现的操作。

关键词

引用

@article{arxiv.2210.09477,
  title  = {UniTune: Text-Driven Image Editing by Fine Tuning a Diffusion Model on a Single Image},
  author = {Dani Valevski and Matan Kalman and Eyal Molad and Eyal Segalis and Yossi Matias and Yaniv Leviathan},
  journal= {arXiv preprint arXiv:2210.09477},
  year   = {2023}
}

备注

SIGGRAPH 2023