FashionEngine:通过多模态控制进行交互式3D人体生成与编辑
计算机视觉与模式识别
2024-05-21 v3
摘要
我们提出了FashionEngine,一个交互式3D人体生成和编辑系统,通过用户友好的多模态控制(如自然语言、视觉感知和手绘草图)创建3D数字人。FashionEngine通过三个关键组件自动化3D人体制作:1)一个预训练的3D人体扩散模型,该模型从2D图像训练数据中学习在语义UV潜在空间中建模3D人体,为多样化的生成和编辑任务提供强先验。2)多模态-UV空间,在规范的UV对齐空间中编码纹理外观、形状拓扑和人体服装的文本语义,将用户的多模态输入与隐式UV潜在空间忠实对齐,以实现可控的3D人体编辑。多模态-UV空间在不同用户输入(如文本、图像和草图)之间共享,从而实现各种联合多模态编辑任务。3)多模态-UV对齐采样器学习从扩散先验中采样高质量且多样化的3D人体。大量实验验证了FashionEngine在条件生成/编辑任务中的最先进性能。此外,我们为FashionEngine提供了一个交互式用户界面,支持条件和无条件生成任务,以及包括姿态/视角/形状控制、文本、图像和草图驱动的3D人体编辑和3D虚拟试穿在内的编辑任务,所有这些都在一个统一框架中。我们的项目页面位于:https://taohuumd.github.io/projects/FashionEngine。
引用
@article{arxiv.2404.01655,
title = {FashionEngine: Interactive 3D Human Generation and Editing via Multimodal Controls},
author = {Tao Hu and Fangzhou Hong and Zhaoxi Chen and Ziwei Liu},
journal= {arXiv preprint arXiv:2404.01655},
year = {2024}
}
备注
Project Page: https://taohuumd.github.io/projects/FashionEngine