仅使用图像实现高保真文本引导三维人脸生成与编辑
计算机视觉与模式识别
2023-09-01 v1
摘要
从文本描述生成三维人脸在游戏、电影和机器人等领域有众多应用。近期进展展示了无条件三维人脸生成与文本到三维形状生成的成功。然而,由于有限的文本-三维人脸数据对,文本驱动的三维人脸生成仍是一个开放问题。本文中,我们提出一种文本引导的三维人脸生成方法,称为TG-3DFace,用于利用文本引导生成逼真三维人脸。具体而言,我们采用无条件三维人脸生成框架并为其配备文本条件,仅通过文本-二维人脸数据学习文本引导的三维人脸生成。在此基础上,我们提出两种文本到人脸的跨模态对齐技术,包括全局对比学习和细粒度对齐模块,以促进生成的三维人脸与输入文本间的高语义一致性。此外,我们在推理过程中提出方向分类器引导,鼓励域外生成的创造性。与现有方法相比,TG-3DFace生成更逼真且更具美感的三维人脸,在多视角一致性(MVIC)上比Latent3D提升9%。TG-3DFace渲染的人脸图像取得了比文本到二维人脸/图像生成模型更高的FID和CLIP分数,证明了我们在生成逼真且语义一致纹理上的优越性。
引用
@article{arxiv.2308.16758,
title = {Towards High-Fidelity Text-Guided 3D Face Generation and Manipulation Using only Images},
author = {Cuican Yu and Guansong Lu and Yihan Zeng and Jian Sun and Xiaodan Liang and Huibin Li and Zongben Xu and Songcen Xu and Wei Zhang and Hang Xu},
journal= {arXiv preprint arXiv:2308.16758},
year = {2023}
}
备注
accepted by ICCV 2023