中文

通过三维感知表情蒸馏实现即时表达性高斯头部Avatar

计算机视觉与模式识别 2025-12-19 v1

摘要

肖像动画得益于近期视频扩散模型的进步而见证了质量的巨大提升。然而,这些二维方法常常牺牲三维一致性和速度,限制了其在数字孪生或远程呈现等真实场景中的应用。相比之下,基于显式三维表示(如神经辐射场或高斯溅射)的三维感知面部动画前馈方法确保了三维一致性并实现了更快的推理速度,但表情细节较差。在本文中,我们旨在结合两者的优势,通过将知识从基于二维扩散的方法蒸馏到前馈编码器中,该编码器可即时将野外单张图像转换为三维一致、快速且可动画化的表达性表示。我们的动画表示与面部的三维表示解耦,并从数据中隐式学习运动,消除了对常限制动画能力的预定义参数模型的依赖。与之前用于融合三维结构和动画信息的计算密集型全局融合机制(如多层注意力)不同,我们的设计采用高效的轻量级局部融合策略以实现高动画表现力。因此,我们的方法在动画和姿态控制方面以 107.31 FPS 运行,同时实现了与最先进方法相当的动画质量,超越了在速度与质量之间取舍的替代设计。项目网站:https://research.nvidia.com/labs/amri/projects/instant4d

关键词

引用

@article{arxiv.2512.16893,
  title  = {Instant Expressive Gaussian Head Avatar via 3D-Aware Expression Distillation},
  author = {Kaiwen Jiang and Xueting Li and Seonwook Park and Ravi Ramamoorthi and Shalini De Mello and Koki Nagano},
  journal= {arXiv preprint arXiv:2512.16893},
  year   = {2025}
}

备注

Project website is https://research.nvidia.com/labs/amri/projects/instant4d