中文

SVAD:通过视频扩散与数据增强从单张图像生成3D虚拟化身

计算机视觉与模式识别 2025-05-09 v1

摘要

从单张图像创建高质量可动画的3D人类虚拟化身仍然是计算机视觉中的一个重大挑战,因为从单一视角重建完整的3D信息本质上很困难。现有方法面临一个明显的局限:3D高斯溅射(3DGS)方法产生高质量结果但需要多视角或视频序列,而视频扩散模型可以从单张图像生成动画但在一致性和身份保持方面存在困难。我们提出了SVAD,一种通过利用现有技术的互补优势来解决这些局限的新方法。我们的方法通过视频扩散生成合成训练数据,通过身份保持和图像恢复模块增强它,并利用这些精炼数据训练3DGS虚拟化身。全面评估表明,SVAD在保持新姿态和视角下的身份一致性和细粒度细节方面优于最先进的单图像方法,同时实现了实时渲染能力。通过我们的数据增强流水线,我们克服了传统3DGS方法通常需要的密集单目或多视角训练数据的依赖。广泛的定量和定性比较表明,我们的方法在多个指标上优于基线模型。通过有效结合扩散模型的生成能力与3DGS的高质量结果和渲染效率,我们的工作建立了从单张图像输入进行高保真虚拟化身生成的新方法。

关键词

引用

@article{arxiv.2505.05475,
  title  = {SVAD: From Single Image to 3D Avatar via Synthetic Data Generation with Video Diffusion and Data Augmentation},
  author = {Yonwoo Choi},
  journal= {arXiv preprint arXiv:2505.05475},
  year   = {2025}
}

备注

Accepted by CVPR 2025 SyntaGen Workshop, Project Page: https://yc4ny.github.io/SVAD/