中文

Avat3r:用于高保真 3D 头部头像的大型可动画高斯重建模型

计算机视觉与模式识别 2025-09-16 v2

摘要

传统上,创建逼真的 3D 头部头像需要工作室级别的多视角捕获 setup,并且在测试阶段需要昂贵的优化,限制了数字人类双胞胎仅能用于特效行业或离线渲染。为此,我们提出了 Avat3r,该方法仅需少量输入图像即可回归出高质量且可动画的 3D 头部头像,大幅降低了推理时的计算要求。更具体地说,我们使大型重建模型具有可动画性,并从大型多视角视频数据集中学习 3D 人类头部的 powerful prior。为了获得更好的 3D 头部重建,我们采用来自 DUSt3R 的位置图和来自人类基础模型 Sapiens 的 generalized 特征图。为了实现 3D 头部的动画,我们的关键发现是,对 expression code 进行 simple cross-attention 就足够了。最后,通过在训练时将不同表情的输入图像馈入我们的模型,以提高鲁棒性,使我们能够从不一致的输入(例如偶发的手机捕获中意外移动的帧,或单目视频的帧)来重建 3D 头部头像。我们与当前在 few-input 和 single-input 场景中的最先进方法进行了比较,发现该方法在两个任务中都具有竞争优势。最后,我们演示了我们提出模型的广泛适用性,可从不同来源的图像(包括智能手机捕获、单张图像,甚至超出域的输入如古董化身)创建 3D 头部头像。项目网站:https://tobias-kirschstein.github.io/avat3r/。

关键词

引用

@article{arxiv.2502.20220,
  title  = {Avat3r: Large Animatable Gaussian Reconstruction Model for High-fidelity 3D Head Avatars},
  author = {Tobias Kirschstein and Javier Romero and Artem Sevastopolsky and Matthias Nießner and Shunsuke Saito},
  journal= {arXiv preprint arXiv:2502.20220},
  year   = {2025}
}

备注

Project website: https://tobias-kirschstein.github.io/avat3r/, Video: https://youtu.be/P3zNVx15gYs