揭示文本引导3D人脸编辑的方向
计算机视觉与模式识别
2024-10-08 v1
摘要
3D人脸编辑是多媒体中的重要任务,旨在操控各种控制信号下的3D人脸模型。成功的3D感知GAN提供了从单视图2D图像中学习的富有表现力的3D模型,鼓励研究人员发现其潜在空间中的语义编辑方向。然而,先前的方法在质量、效率和泛化之间面临挑战。为此,我们探索引入扩散模型强度于3D感知GAN的可能性。本文提出了Face Clan,一种基于任意属性描述生成和操控3D人脸的快速且文本通用的方法。为实现解耦编辑,我们提出在一对相反提示词下对潜在空间进行扩散,以估计潜在代码上感兴趣区域的掩码。基于该掩码,我们随后对被掩码的潜在代码进行去噪,以揭示编辑方向。我们的方法提供了一种精确可控的操控方法,允许用户通过文本描述直观地定制感兴趣区域。实验表明,Face Clan在各种预训练GAN上具有有效性和泛化性。它为文本引导的人脸编辑提供了直观且广泛的应用,为多媒体内容创建的生态系统贡献了突破。
引用
@article{arxiv.2410.04965,
title = {Revealing Directions for Text-guided 3D Face Editing},
author = {Zhuo Chen and Yichao Yan and Sehngqi Liu and Yuhao Cheng and Weiming Zhao and Lincheng Li and Mengxiao Bi and Xiaokang Yang},
journal= {arXiv preprint arXiv:2410.04965},
year = {2024}
}