基于模型先验的一次性隐式可动画化虚拟形象
计算机视觉与模式识别
2023-09-28 v4 人工智能
图形学
摘要
现有的用于创建人体虚拟形象的神经渲染方法通常要么需要诸如视频或多视角图像等密集输入信号,要么利用从大规模特定 3D 人体数据集中学习到的先验,从而可以用稀疏视角输入进行重建。当仅有一张图像可用时,这些方法大多无法实现逼真重建。为实现数据高效创建逼真可动画 3D 人体,我们提出 ELICIT,一种从单张图像学习人体特定神经辐射场的新方法。受人类能从单张图像轻松估计身体几何并想象全身衣物这一事实的启发,我们在 ELICIT 中利用两个先验:3D 几何先验与视觉语义先验。具体而言,ELICIT 利用来自基于蒙皮顶点的模板模型(即 SMPL)的 3D 身体形状几何先验,并用基于 CLIP 的预训练模型实现视觉衣物语义先验。两个先验共同指导优化以在不可见区域创建合理内容。借助 CLIP 模型,ELICIT 可使用文本描述生成文本条件的不可见区域。为进一步改善视觉细节,我们提出一种基于分割的采样策略,对虚拟形象不同部分进行局部细化。在 ZJU-MoCAP、Human3.6M 和 DeepFashion 等多个流行基准上的综合评估表明,在仅有一张图像可用时,ELICIT 优于强大的虚拟形象创建基线方法。代码已公开用于研究目的:https://huangyangyi.github.io/ELICIT/。
引用
@article{arxiv.2212.02469,
title = {One-shot Implicit Animatable Avatars with Model-based Priors},
author = {Yangyi Huang and Hongwei Yi and Weiyang Liu and Haofan Wang and Boxi Wu and Wenxiao Wang and Binbin Lin and Debing Zhang and Deng Cai},
journal= {arXiv preprint arXiv:2212.02469},
year = {2023}
}
备注
To appear at ICCV 2023. Project website: https://huangyangyi.github.io/ELICIT/