MVHuman:利用多视图采样定制2D扩散实现逼真的3D人体生成
计算机视觉与模式识别
2023-12-19 v1
摘要
近几个月来,基于扩散模型的3D生成取得了快速进展。大多数进展需要将现有的2D稳定扩散微调为多视图设置,或进行繁琐的蒸馏操作,因此由于缺乏多样化的3D人体数据集,在3D人体生成方面表现不足。我们提出了一种名为MVHuman的替代方案,从文本引导生成人体辐射场,直接从预训练的稳定扩散中采样一致的多视图图像,无需任何微调或蒸馏。我们的核心是一种多视图采样策略,用于定制预训练网络的去噪过程,以生成一致的多视图图像。它包含视图一致的条件化、用“一致性引导噪声”替换原始噪声、优化潜在编码以及利用跨视图注意力层。通过采样过程获得多视图图像后,我们采用几何细化和3D辐射场生成,随后进行神经混合方案以实现自由视角渲染。大量实验证明了我们方法的有效性,以及其相对于最先进的3D人体生成方法的优越性。
引用
@article{arxiv.2312.10120,
title = {MVHuman: Tailoring 2D Diffusion with Multi-view Sampling For Realistic 3D Human Generation},
author = {Suyi Jiang and Haimin Luo and Haoran Jiang and Ziyu Wang and Jingyi Yu and Lan Xu},
journal= {arXiv preprint arXiv:2312.10120},
year = {2023}
}