中文

AvatarFusion:基于 2D 扩散的零样本服装解耦 3D 虚拟人生成

计算机视觉与模式识别 2023-09-15 v2 图形学

摘要

大规模预训练视觉-语言模型使得基于文本的零样本 3D 虚拟人生成成为可能。先前的最优方法利用 CLIP 来监督重建人体网格的神经隐式模型。然而,该方法存在两个局限。首先,缺乏虚拟人专用模型会导致生成虚拟人的面部扭曲和服装不真实。其次,CLIP 仅提供整体外观的优化方向,导致生成效果不够理想。为克服这些局限,我们提出 AvatarFusion,这是首个使用潜在扩散模型为生成逼真人体虚拟人提供像素级引导,同时将从虚拟人身体上分割服装的框架。AvatarFusion 包含首个服装解耦神经隐式虚拟人模型,其采用一种新颖的双体积渲染(Dual Volume Rendering)策略,在同一空间中渲染解耦的皮肤与服装子模型。我们还引入一种称为像素-语义差异采样(Pixel-Semantics Difference-Sampling, PS-DS)的新优化方法,该方法在语义上分离身体与服装的生成,并生成多种服装风格。此外,我们建立了首个零样本文本到虚拟人生成的基准。实验结果表明,我们的框架优于先前方法,在所有指标上均观察到显著提升。另外,由于我们的模型是服装解耦的,我们可以交换虚拟人的服装。代码已发布于我们的项目页 https://hansenhuang0823.github.io/AvatarFusion。

关键词

引用

@article{arxiv.2307.06526,
  title  = {AvatarFusion: Zero-shot Generation of Clothing-Decoupled 3D Avatars Using 2D Diffusion},
  author = {Shuo Huang and Zongxin Yang and Liangting Li and Yi Yang and Jia Jia},
  journal= {arXiv preprint arXiv:2307.06526},
  year   = {2023}
}

备注

Accepted by ACM Multimedia 2023