通过空间对齐实现任意文本驱动的图像编辑
计算机视觉与模式识别
2023-09-22 v3
摘要
近期的 GAN 反演方法已能成功将真实图像输入反演为 StyleGAN 中相应的可编辑潜码。结合语言-视觉模型(CLIP),一些文本驱动的图像编辑方法被提出。然而,这些方法需要额外代价来针对特定图像或新属性编辑模式进行优化。为获得更高效的编辑方法,我们提出了一种通过空间对齐的文本驱动图像编辑框架(TMSA)。空间对齐模块旨在对齐 CLIP 与 StyleGAN 空间中相同的语义区域。随后,文本输入可直接进入 StyleGAN 空间,并用于根据文本描述寻找语义偏移。该框架可在无额外代价的情况下支持任意图像编辑模式。我们的工作为用户提供了一个接口,可根据文本输入控制给定图像的属性并实时获得结果。大量实验证明了我们相对于先前方法的优越性能。
引用
@article{arxiv.2301.10670,
title = {Towards Arbitrary Text-driven Image Manipulation via Space Alignment},
author = {Yunpeng Bai and Zihan Zhong and Chao Dong and Weichen Zhang and Guowei Xu and Chun Yuan},
journal= {arXiv preprint arXiv:2301.10670},
year = {2023}
}
备注
8 pages, 12 figures