中文

FMGS-Avatar: 基于基础模型先验的网格引导二维高斯溅射用于三维单目Avatar重建

计算机视觉与模式识别 2025-09-19 v1

摘要

从单目视频重建高保真可动画人类 Avatar 仍然具有挑战性,因为单目观测提供的几何信息不足。虽然最近的三维高斯溅射方法显示出前景,但由于三维高斯基元的自由形态特性,它们在表面细节保持方面存在困难。为同时解决表示限制和信息稀缺问题,我们提出了一种新方法 FMGS-Avatar,它整合了两项关键创新。首先,我们引入了网格引导二维高斯溅射,其中二维高斯基元直接附着在模板网格面上,并受约束的位置、旋转和运动,从而实现更优的表面对齐和几何细节保持。其次,我们利用在大规模数据集上训练的基础模型(如 Sapiens)来补充单目视频提供的有限视觉线索。然而,在从基础模型中蒸馏多模态先验知识时,当不同模态表现出不同的参数敏感性时,会出现冲突的优化目标。我们通过协调训练策略和选择性梯度隔离来解决这一问题,使每个损失分量能够在不受干扰的情况下优化其相关参数。通过这种增强表示与协调信息蒸馏的结合,我们的方法显著推进了三维单目人类 Avatar 重建。实验评估表明,与现有方法相比,我们的重建质量更优,在几何精度和外观保真度方面有显著提升,同时提供了丰富的语义信息。此外,共享规范空间中蒸馏的先验知识自然地实现了在新视角和新姿态下的空间和时间一致性渲染。

关键词

引用

@article{arxiv.2509.14739,
  title  = {FMGS-Avatar: Mesh-Guided 2D Gaussian Splatting with Foundation Model Priors for 3D Monocular Avatar Reconstruction},
  author = {Jinlong Fan and Bingyu Hu and Xingguang Li and Yuxiang Yang and Jing Zhang},
  journal= {arXiv preprint arXiv:2509.14739},
  year   = {2025}
}