基于文本提示的零样本物理可解释人脸编辑
计算机视觉与模式识别
2023-08-14 v1
摘要
本文提出一种基于任意文本提示的、新颖且物理可解释的人脸编辑方法。与以往基于 GAN 反演、操纵 GAN 潜空间的人脸编辑方法,或将图像操纵建模为反向扩散过程的基于扩散的方法不同,我们将人脸编辑过程视为在人脸图像上施加向量流场,表示每个图像像素的空间坐标和颜色的偏移。在上述提出的范式下,我们以两种方式表示向量流场:1)用光栅化张量显式表示流向量;2)利用隐式神经表示的最新进展,将流向量隐式参数化为连续的、平滑的且与分辨率无关的神经场。在预训练的对比语言-图像预训练(CLIP)模型指导下,通过最大化编辑后图像与文本提示之间的相关性,迭代优化流向量。我们还提出了一种基于学习的一次性人脸编辑框架,其快速且可适配任意文本提示输入。我们的方法也可灵活扩展到实时视频人脸编辑。与最先进的文本驱动人脸编辑方法相比,我们的方法能生成具有高身份一致性和图像质量的物理可解释人脸编辑结果。我们的代码将公开可用。
引用
@article{arxiv.2308.05976,
title = {Zero-shot Text-driven Physically Interpretable Face Editing},
author = {Yapeng Meng and Songru Yang and Xu Hu and Rui Zhao and Lincheng Li and Zhenwei Shi and Zhengxia Zou},
journal= {arXiv preprint arXiv:2308.05976},
year = {2023}
}