VASA-3D:从单张图像生成逼真的音频驱动高斯头部化身
计算机视觉与模式识别
2025-12-17 v1 人工智能
摘要
我们提出了 VASA-3D,一种音频驱动的单次生成三维头部化身生成器。本研究攻克了两大挑战:捕捉真实人类面部中细微的表情细节,以及从单张肖像图像重建复杂的三维头部化身。为精确建模表情细节,VASA-3D 利用 VASA-1 的运动潜变量,该方法在二维说话头部生成中实现了卓越的逼真度和生动性。本工作的关键要素是将该运动潜变量映射到三维,这通过设计一个以运动潜变量为条件的三维头部模型来实现。通过一个优化框架,利用从输入图像合成的参考头部的众多视频帧对该模型进行单图定制。该优化采用了对生成训练数据中的伪影和有限姿态覆盖具有鲁棒性的多种训练损失。实验表明,VASA-3D 生成的真实三维说话头部是先前方法无法实现的,并且支持以最高 75 FPS 在线生成 512×512 自由视角视频,从而促进与逼真三维化身更具沉浸感的交互。
引用
@article{arxiv.2512.14677,
title = {VASA-3D: Lifelike Audio-Driven Gaussian Head Avatars from a Single Image},
author = {Sicheng Xu and Guojun Chen and Jiaolong Yang and Yizhong Zhang and Yu Deng and Steve Lin and Baining Guo},
journal= {arXiv preprint arXiv:2512.14677},
year = {2025}
}
备注
NeurIPS 2025 paper. Project webpage: https://www.microsoft.com/en-us/research/project/vasa-3d/