中文

NoPo-Avatar:基于稀疏输入的通用可动画人形 without 人类姿态

计算机视觉与模式识别 2025-11-21 v1

摘要

我们解决从单个或稀疏图像中恢复可动画 3D 人类头像的任务。对于该任务,许多先前的 SOTA 方法会使用准确的“ground-truth”相机姿态和人类姿态作为输入,以指导测试时的重建。在本文中,我们表明,如果姿态估计噪声,姿态依赖的重建会显著降低结果。为克服这一问题,我们引入 NoPo-Avatar,仅从图像重建头像,不使用任何姿态输入。通过消除测试时重建对人类姿态的依赖,NoPo-Avatar 不受噪声人类姿态估计的影响,更具适用性。在具有挑战性的 THuman2.0、XHuman 和 HuGe100K 数据集上的实验表明,NoPo-Avatar 在实际场景(无 ground-truth 姿态)下优于现有基线,并在实验室场景(有 ground-truth 姿态)下表现相当。

关键词

引用

@article{arxiv.2511.16673,
  title  = {NoPo-Avatar: Generalizable and Animatable Avatars from Sparse Inputs without Human Poses},
  author = {Jing Wen and Alexander G. Schwing and Shenlong Wang},
  journal= {arXiv preprint arXiv:2511.16673},
  year   = {2025}
}

备注

NeurIPS'25; project page: https://wenj.github.io/NoPo-Avatar/