基于生成式预训练画师的端到端视觉编辑
计算机视觉与模式识别
2022-05-04 v1
摘要
我们考虑目标图像编辑问题:将源图像中的某个区域与指定所需变化的驱动图像相融合。与先前工作不同,我们通过端到端地学习编辑的条件概率分布来解决该问题。训练这样的模型需要解决一个基本技术挑战:缺乏用于训练的编辑示例。为此,我们提出了一种自监督方法,通过对目标领域中现成图像进行增强来模拟编辑。其优势显著:作为最先进的自回归 transformer 实现,我们的方法简洁,规避了以往基于类 GAN 先验方法的困难,获得了明显更好的编辑效果,并且高效。此外,我们表明通过对增强过程的直观控制即可学习到不同的融合效果,而无需对模型架构做任何其他改动。我们在多个数据集上通过大量定量与定性实验(包括人类研究)证明了该方法的优越性,显著优于先前工作。
引用
@article{arxiv.2205.01668,
title = {End-to-End Visual Editing with a Generatively Pre-Trained Artist},
author = {Andrew Brown and Cheng-Yang Fu and Omkar Parkhi and Tamara L. Berg and Andrea Vedaldi},
journal= {arXiv preprint arXiv:2205.01668},
year = {2022}
}