中文

通过空间对齐实现任意文本驱动的图像编辑

计算机视觉与模式识别 2023-09-22 v3

摘要

近期的 GAN 反演方法已能成功将真实图像输入反演为 StyleGAN 中相应的可编辑潜码。结合语言-视觉模型(CLIP),一些文本驱动的图像编辑方法被提出。然而,这些方法需要额外代价来针对特定图像或新属性编辑模式进行优化。为获得更高效的编辑方法,我们提出了一种通过空间对齐的文本驱动图像编辑框架(TMSA)。空间对齐模块旨在对齐 CLIP 与 StyleGAN 空间中相同的语义区域。随后,文本输入可直接进入 StyleGAN 空间,并用于根据文本描述寻找语义偏移。该框架可在无额外代价的情况下支持任意图像编辑模式。我们的工作为用户提供了一个接口,可根据文本输入控制给定图像的属性并实时获得结果。大量实验证明了我们相对于先前方法的优越性能。

关键词

引用

@article{arxiv.2301.10670,
  title  = {Towards Arbitrary Text-driven Image Manipulation via Space Alignment},
  author = {Yunpeng Bai and Zihan Zhong and Chao Dong and Weichen Zhang and Guowei Xu and Chun Yuan},
  journal= {arXiv preprint arXiv:2301.10670},
  year   = {2023}
}

备注

8 pages, 12 figures