中文

通过直接跨模态映射与几何正则化实现快速文本感知 3D 人脸生成与操控

计算机视觉与模式识别 2024-08-30 v3

摘要

文本感知 3D 人脸(T3D Face)生成与操控是机器学习领域新兴的研究热点,但仍存在效率低和质量差的问题。本文提出了一种端到端高效且有效的网络 E3E^3-FaceNet,用于快速且准确的 T3D 人脸生成与操控。与现有的复杂生成范式不同,E3E^3-FaceNet 采用从文本指令到 3D 感知视觉空间的直接映射。我们引入了一种新颖的风格代码增强器(Style Code Enhancer)以增强跨模态语义对齐,并提出一种创新的几何正则化目标以保持多视角生成的一致性。在三个基准数据集上的大量实验表明,E3E^3-FaceNet 不仅能实现照片级的 3D 人脸生成与操控,还能将推理速度提高数个数量级。例如,与 Latent3D 相比,E3E^3-FaceNet 将五视角生成速度提升了近 470 倍,同时生成质量更优。我们的代码已发布于 https://github.com/Aria-Zhangjl/E3-FaceNet。

关键词

引用

@article{arxiv.2403.06702,
  title  = {Fast Text-to-3D-Aware Face Generation and Manipulation via Direct Cross-modal Mapping and Geometric Regularization},
  author = {Jinlu Zhang and Yiyi Zhou and Qiancheng Zheng and Xiaoxiong Du and Gen Luo and Jun Peng and Xiaoshuai Sun and Rongrong Ji},
  journal= {arXiv preprint arXiv:2403.06702},
  year   = {2024}
}