LiftAvatar:用于表达控制3D高斯人像动画的运动空间完成
计算机视觉与模式识别
2026-03-03 v1 人工智能
摘要
我们提出了LiftAvatar,这是一种新的范式,通过完成运动空间(如面部表情和头部姿态)中的稀疏单眼观察数据,并利用完成的信号驱动高保真人像动画。LiftAvatar 是一种基于Transformer的细粒度、可表达控制的大规模视频扩散模型,能够合成以单张或多张参考图像为条件的高质量、时序一致的表情序列。关键思想是将不完整的输入数据提升到更丰富的运动表示,从而增强下游3D人像管道中的重建和动画。为此,我们引入(i)一种多粒度表达控制方案,将阴影图与表情系数结合,以实现精确且稳定的驱动,以及(ii)一种多参考条件机制,从多个帧中聚合互补线索,实现强大的3D一致性和可控性。作为即插即用的增强器,LiftAvatar 直接解决了由于稀疏运动线索在日常单眼视频中导致的3D高斯渲染人像的表达受限和重建伪影问题。通过将不完整的观察扩展到多样化的姿态-表情变化,LiftAvatar 还能够从大规模视频生成模型中有效地提取先验知识到3D管道中,显著提升性能。在大量实验中,LiftAvatar 在3D人像方法的动画质量和定量指标上实现了持续性提升,尤其在极端且未见的表情下效果尤为显著。
引用
@article{arxiv.2603.02129,
title = {LiftAvatar: Kinematic-Space Completion for Expression-Controlled 3D Gaussian Avatar Animation},
author = {Hualiang Wei and Shunran Jia and Jialun Liu and Wenhui Li},
journal= {arXiv preprint arXiv:2603.02129},
year = {2026}
}
备注
19 pages, 11 figures