中文

HumanSplatHMR:在人类网格恢复与高斯溅射头像之间架起闭环

计算机视觉与模式识别 2026-05-22 v2

摘要

准确地从视频中恢复人类姿态与外观是场景重建的关键组成部分,广泛应用于运动捕捉、运动预测、虚拟现实和数字孪生等领域。尽管对从视频构建逼真人类头像的兴趣持续增长,但本文表明现有方法无法准确恢复人的3D几何。基于ViT的方法不可靠且易过拟合到2D视图,而基于NeRF和高斯溅射的头像将姿态与外观分离,限制了对新姿态的渲染泛化。为解决这些不足,本文提出HumanSplatHMR,一种联合优化框架,既优化3D人类姿态,又同步学习高保真头像,以实现新视角和新姿态的合成。我们的关键洞察在于将几何姿态估计与可微分渲染闭环。与之前的人类头像方法不同,后者依赖于通过运动捕捉系统或离线细化获得的精确人类姿态,这在野外场景中不够实用。我们的做法仅使用来自最新人类姿态估计器的人体网格估计,以更贴近现实世界条件。因此,HumanSplatHMR不仅将人类姿态仅用作变形先验,还通过可微分渲染器反向传播光度损失、分割损失和深度损失到姿态参数和全局位置,从而实现对全局3D姿态的时间性细化,提高精度和对齐度,同时提升新视角渲染质量。实验表明,相比忽略图像级细化的姿态恢复基线,以及相比解耦姿态估计与头像重建的头像基线,HumanSplatHMR在姿态恢复和头像构建方面均实现了持续的改进。

关键词

引用

@article{arxiv.2605.02784,
  title  = {HumanSplatHMR: Closing the Loop Between Human Mesh Recovery and Gaussian Splatting Avatar},
  author = {Yeheng Zong and Pou-Chun Kung and Yike Pan and Seth Isaacson and Yizhou Chen and Ram Vasudevan and Katherine A. Skinner},
  journal= {arXiv preprint arXiv:2605.02784},
  year   = {2026}
}

备注

Project page: https://scottyehengz.github.io/HumanSplat/