Teller:基于自回归运动生成的实时音频驱动人像动画
计算机视觉与模式识别
2025-03-25 v1
摘要
本工作引入了第一个用于实时音频驱动人像动画(即说话头)的自回归框架。除处理动画持续时间这一挑战外,保持多样化身体部位自然运动也是实现逼真说话头生成的关键挑战。为此,我们提出Teller,即第一个具备自回归运动生成的流式音频驱动人像动画框架。具体而言,Teller将面部和身体细节动画分解为两个组件:基于自回归转换器的面部运动潜在生成(FMLG),以及使用高效时间模块(ETM)的运动真实性细化。具体地,FMLG采用残差VQ模型将隐式关键点模型中的面部运动潜�分离为离散运动标记,这些标记随音频嵌入被时间分片。这使AR转换器能够学习从音频到运动的实时、基于流的映射。此外,Teller融合ETM以捕获更细致的运动细节。该模块确保身体部位和配饰(如颈肌和耳环)的物理一致性,提高了这些运动的逼真度。Teller设计高效,超过基于扩散模型的推理速度(Halo 20.93s vs. Teller 0.92s用于生成一秒视频),实现最高可达25 FPS的实时流式性能。大量实验表明,我们的方法在音频驱动人像动画中超越了最新方法,尤其在小幅运动方面,通过人类评估在质量和逼真度方面显著优于其他方法。
引用
@article{arxiv.2503.18429,
title = {Teller: Real-Time Streaming Audio-Driven Portrait Animation with Autoregressive Motion Generation},
author = {Dingcheng Zhen and Shunshun Yin and Shiyang Qin and Hou Yi and Ziwei Zhang and Siyuan Liu and Gan Qi and Ming Tao},
journal= {arXiv preprint arXiv:2503.18429},
year = {2025}
}
备注
Accept in CVPR 2025 Conference Submission