在StyleGAN与CLIP潜空间中自适应探索方向的鲁棒文本驱动图像编辑方法
计算机视觉与模式识别
2023-04-04 v1 计算与语言
摘要
自动图像编辑因应用广泛而需求巨大,而使用自然语言指令对于实现用户所设想的灵活直观编辑至关重要。文本驱动图像编辑的先驱工作StyleCLIP在CLIP空间中寻找编辑方向,然后通过将该方向映射到StyleGAN空间来编辑图像。同时,除原始图像和文本指令外,难以调优合适的输入用于图像编辑。在本研究中,我们提出一种利用SVM在StyleGAN和CLIP空间中自适应构建编辑方向的方法。我们的模型将编辑方向表示为CLIP空间中的法向量,该向量通过训练SVM对正、负图像进行分类获得。图像根据图像与文本指令之间的CLIP相似度从用于预训练StyleGAN的大规模图像语料库中检索。我们确认,我们的模型表现与StyleCLIP基线相当,同时允许简单输入且不增加计算时间。
引用
@article{arxiv.2304.00964,
title = {Robust Text-driven Image Editing Method that Adaptively Explores Directions in Latent Spaces of StyleGAN and CLIP},
author = {Tsuyoshi Baba and Kosuke Nishida and Kyosuke Nishida},
journal= {arXiv preprint arXiv:2304.00964},
year = {2023}
}