Human-VDM:从视频扩散模型学习单图像 3D 人体高斯溅射
计算机视觉与模式识别
2025-10-13 v1 图形学
摘要
从单张 RGB 图像生成逼真的 3D 人体仍然是计算机视觉中一项具有挑战性的任务,因为它需要准确的几何建模、高质量的纹理以及合理的不可见部分。现有方法通常使用多视图扩散模型进行 3D 生成,但它们经常面临视图不一致的问题,这阻碍了高质量的 3D 人体生成。为了解决这个问题,我们提出了 Human-VDM,一种使用视频扩散模型从单张 RGB 图像生成 3D 人体的新方法。Human-VDM 使用高斯溅射为 3D 人体生成提供时间一致的视图。它由三个模块组成:视图一致的人体视频扩散模块、视频增强模块和高斯溅射模块。首先,将单张图像输入到人体视频扩散模块以生成连贯的人体视频。接下来,视频增强模块应用超分辨率和视频插值来增强生成视频的纹理和几何平滑度。最后,3D 人体高斯溅射模块在这些高分辨率和视图一致的图像指导下学习逼真的人体。实验表明,Human-VDM 从单张图像实现了高质量的 3D 人体,在生成质量和数量上均优于 SOTA 方法。项目页面:https://human-vdm.github.io/Human-VDM/
引用
@article{arxiv.2409.02851,
title = {Human-VDM: Learning Single-Image 3D Human Gaussian Splatting from Video Diffusion Models},
author = {Zhibin Liu and Haoye Dong and Aviral Chharia and Hefeng Wu},
journal= {arXiv preprint arXiv:2409.02851},
year = {2025}
}
备注
14 Pages, 8 figures, Project page: https://human-vdm.github.io/Human-VDM/