中文

基于单眼RGB视频的表达性高斯人类头像

计算机视觉与模式识别 2024-07-04 v1

摘要

细粒度手部和面部表情的表达性对于增强数字人类表示的真实感和活力至关重要。本文聚焦于从单眼RGB视频中学习人类头像的表达性;这一设置引入了捕获和动画细节的新挑战。为此,我们引入EVA,一个可驾驭的人类模型,通过3D高斯和SMPL-X(一个表达性参数化人类模型)精细雕刻细节。围绕提升表达性,我们的工作做出了三个关键贡献:首先,我们强调了将SMPL-X模型与RGB帧对齐对于有效头像学习的重要性。鉴于当前SMPL-X预测方法在野外视频中的局限性,我们引入了一个即插即用模块,显著改善了对齐问题。其次,我们提出一种情境感知自适应密度控制策略,自适应调整梯度阈值以适应身体部位的不同细粒度。最后,我们开发了一种反馈机制,用于预测每个像素的置信度,以更好地引导3D高斯的学习。在两个基准数据集上的大量实验表明,我们的框架在定量和定性方面都优于现有方法,尤其在细粒度手部和面部细节方面。项目网站请访问\url{https://evahuman.github.io}。

关键词

引用

@article{arxiv.2407.03204,
  title  = {Expressive Gaussian Human Avatars from Monocular RGB Video},
  author = {Hezhen Hu and Zhiwen Fan and Tianhao Wu and Yihan Xi and Seoyoung Lee and Georgios Pavlakos and Zhangyang Wang},
  journal= {arXiv preprint arXiv:2407.03204},
  year   = {2024}
}