HuGeDiff: 通过扩散模型实现 3D 人类生成
计算机视觉与模式识别
2025-06-06 v1
摘要
3D 人类生成是计算机视觉和图形学中一个重要问题,具有广泛的应用前景。尽管近期在生成式 AI 方面取得了进展,如扩散模型或神经辐射场等渲染方法,但控制从文本提示生成准确 3D 人类的能力仍是开放挑战。当前方法在细节、手部和面部的准确渲染、人类真实性以及外观控制方面存在困难。人类图像数据中的多样性、真实性和标注不足也成为挑战,阻碍了基础 3D 人类模型的发展。我们提出了一个弱监督管线,旨�解决这些挑战。第一步,我们使用最新图像扩散模型生成具有可控属性(如外观、种族、性别等)的照片级人类图像数据集。下一步,我们提出一种高效的方法,将图像特征映射到 3D 点云,使用基于 Transformer 的架构。最后,我们通过训练以相同文本提示生成的点云扩散模型来闭合循环。我们展示了相较于当前最佳方法,在 3D 人类生成中实现数量级速度提升,同时显著提高文本提示对齐度、真实性和渲染质量。我们将公开代码和数据集。
引用
@article{arxiv.2506.04351,
title = {HuGeDiff: 3D Human Generation via Diffusion with Gaussian Splatting},
author = {Maksym Ivashechkin and Oscar Mendez and Richard Bowden},
journal= {arXiv preprint arXiv:2506.04351},
year = {2025}
}