MagicMan:基于 3D 感知扩散与迭代优化的生成式人体新视角合成
计算机视觉与模式识别
2024-08-27 v1 人工智能
摘要
由于训练数据不足或缺乏全面的多视角知识导致 3D 不一致,单图像人体重建的现有工作泛化能力较弱。本文介绍了 MagicMan,这是一种特定于人体的多视角扩散模型,旨在从单张参考图像生成高质量的新视角图像。其核心在于,我们利用预训练的 2D 扩散模型作为生成先验以提升泛化能力,并以参数化 SMPL-X 模型作为 3D 身体先验以增强 3D 感知。为了解决在实现密集多视角生成以改进 3D 人体重建时维持一致性的关键挑战,我们首先引入混合多视角注意力机制,以促进不同视角间高效且充分的信息交互。此外,我们提出了一种几何感知双分支,在 RGB 和法线域中同时进行生成,通过几何线索进一步增强一致性。最后,为了解决因不准确的 SMPL-X 估计与参考图像冲突而产生的形状失真问题,我们提出了一种新颖的迭代优化策略,逐步提高 SMPL-X 的精度,同时提升生成多视角的质量与一致性。大量实验结果表明,我们的方法在新视角合成及后续的 3D 人体重建任务中均显著优于现有方法。
引用
@article{arxiv.2408.14211,
title = {MagicMan: Generative Novel View Synthesis of Humans with 3D-Aware Diffusion and Iterative Refinement},
author = {Xu He and Xiaoyu Li and Di Kang and Jiangnan Ye and Chaopeng Zhang and Liyang Chen and Xiangjun Gao and Han Zhang and Zhiyong Wu and Haolin Zhuang},
journal= {arXiv preprint arXiv:2408.14211},
year = {2024}
}
备注
Project Page: https://thuhcsi.github.io/MagicMan