通过直接跨模态映射与几何正则化实现快速文本感知 3D 人脸生成与操控
计算机视觉与模式识别
2024-08-30 v3
摘要
文本感知 3D 人脸(T3D Face)生成与操控是机器学习领域新兴的研究热点,但仍存在效率低和质量差的问题。本文提出了一种端到端高效且有效的网络 -FaceNet,用于快速且准确的 T3D 人脸生成与操控。与现有的复杂生成范式不同,-FaceNet 采用从文本指令到 3D 感知视觉空间的直接映射。我们引入了一种新颖的风格代码增强器(Style Code Enhancer)以增强跨模态语义对齐,并提出一种创新的几何正则化目标以保持多视角生成的一致性。在三个基准数据集上的大量实验表明,-FaceNet 不仅能实现照片级的 3D 人脸生成与操控,还能将推理速度提高数个数量级。例如,与 Latent3D 相比,-FaceNet 将五视角生成速度提升了近 470 倍,同时生成质量更优。我们的代码已发布于 https://github.com/Aria-Zhangjl/E3-FaceNet。
引用
@article{arxiv.2403.06702,
title = {Fast Text-to-3D-Aware Face Generation and Manipulation via Direct Cross-modal Mapping and Geometric Regularization},
author = {Jinlu Zhang and Yiyi Zhou and Qiancheng Zheng and Xiaoxiong Du and Gen Luo and Jun Peng and Xiaoshuai Sun and Rongrong Ji},
journal= {arXiv preprint arXiv:2403.06702},
year = {2024}
}