音频驱动的通用高斯头部化身
计算机视觉与模式识别
2025-09-24 v1
摘要
我们提出了首个音频驱动的通用照片级真实化身合成方法,该方法结合了一个与人物无关的语音模型和我们新颖的通用头部化身先验 (UHAP)。UHAP 在跨身份多视角视频上进行训练。特别是,我们的 UHAP 使用中性扫描数据进行监督,使其能够高保真地捕捉身份特定的细节。与先前主要将音频特征映射到几何变形而忽略音频相关外观变化的方法不同,我们的通用语音模型直接将原始音频输入映射到 UHAP 的潜在表情空间。该表情空间固有地编码了几何和外观变化。为了高效地个性化到新对象,我们采用了一个单目编码器,它能够对视频帧间的动态表情变化进行轻量级回归。通过考虑这些表情依赖的变化,它使得后续的模型微调阶段能够专注于捕捉对象的全局外观和几何。通过 UHAP 解码这些音频驱动的表情代码,可以生成高度逼真的化身,具有精确的唇音同步和细腻的表情细节,如眉毛运动、视线移动以及逼真的口腔内部外观和运动。广泛的评估表明,我们的方法不仅是首个能够解释详细外观建模和渲染的可泛化音频驱动化身模型,而且在衡量唇音同步准确性、定量图像质量和感知真实感的指标上,也优于(仅几何的)竞争方法。
引用
@article{arxiv.2509.18924,
title = {Audio-Driven Universal Gaussian Head Avatars},
author = {Kartik Teotia and Helge Rhodin and Mohit Mendiratta and Hyeongwoo Kim and Marc Habermann and Christian Theobalt},
journal= {arXiv preprint arXiv:2509.18924},
year = {2025}
}
备注
(SIGGRAPH Asia 2025) Project page: https://kartik-teotia.github.io/UniGAHA/