文本与图像引导的 3D 虚拟形象生成与操控
计算机视觉与模式识别
2022-02-15 v1 图形学
机器学习
摘要
潜在空间的操控近来成为生成模型领域一个有趣的话题。近期研究表明,潜在方向可用于将图像向特定属性操控。然而,控制 3D 生成模型的生成过程仍具挑战。本工作中,我们提出一种新颖的 3D 操控方法,可使用基于文本或图像的提示(如“年轻的面孔”或“惊讶的面孔”)同时操控模型的形状与纹理。我们利用对比语言-图像预训练(CLIP)模型的能力以及为生成人脸虚拟形象而设计的预训练 3D GAN 模型,并构建全可微渲染流水线来操控网格。更具体地,我们的方法接收输入潜在码并对其进行修改,使得由文本或图像提示指定的目标属性出现或增强,同时基本不影响其他属性。我们的方法每次操控仅需 5 分钟,并通过大量结果与对比展示了方法的有效性。
引用
@article{arxiv.2202.06079,
title = {Text and Image Guided 3D Avatar Generation and Manipulation},
author = {Zehranaz Canfes and M. Furkan Atasoy and Alara Dirik and Pinar Yanardag},
journal= {arXiv preprint arXiv:2202.06079},
year = {2022}
}