中文

DiHuR:扩散引导的可泛化人体重建

计算机视觉与模式识别 2025-04-01 v2

摘要

我们引入了DiHuR,一种新颖的扩散引导模型,用于从稀疏且重叠极少的图像中进行可泛化的人体三维重建和新视角合成。虽然现有的可泛化人体辐射场在新视角合成方面表现出色,但它们在全面的三维重建中常常遇到困难。同样,直接从稀疏视角图像中优化隐式符号距离函数(SDF)场通常会因为重叠有限而产生较差的结果。为了提高三维重建质量,我们提出使用与SMPL顶点相关联的可学习token来聚合稀疏视角特征,进而引导SDF预测。这些token在训练数据集中学习跨不同身份的可泛化先验,利用SMPL顶点在各种人体身份上投影到相似语义区域的一致性。这种一致性使得在推理期间能够将知识有效迁移至未见过的身份。认识到SMPL在捕捉衣物细节方面的局限性,我们引入扩散模型作为额外先验来填补缺失信息,特别是针对复杂的衣物几何形状。我们的方法以连贯的方式整合了两个关键先验:来自可泛化前馈模型的先验和二维扩散先验,且仅需多视角图像训练,无需三维监督。DiHuR在THuman、ZJU-MoCap和HuMMan数据集上得到了验证,与现有方法相比,其在数据集内和数据集间泛化设置中均展现出卓越性能。

关键词

引用

@article{arxiv.2411.11903,
  title  = {DiHuR: Diffusion-Guided Generalizable Human Reconstruction},
  author = {Jinnan Chen and Chen Li and Gim Hee Lee},
  journal= {arXiv preprint arXiv:2411.11903},
  year   = {2025}
}

备注

Accepted to WACV 2025