PersonaLive! 面向直播的富有表现力的人物肖像图像动画
计算机视觉与模式识别
2025-12-15 v1
摘要
当前基于扩散模型的人物肖像动画模型主要关注视觉质量和表情真实感,而忽视了生成延迟和实时性能,这限制了其在直播场景中的应用范围。我们提出了 PersonaLive,一个面向直播实时人物肖像动画的新型扩散框架,采用多阶段训练策略。具体而言,我们首先采用混合隐式信号,即隐式面部表示和三维隐式关键点,以实现富有表现力的图像级运动控制。然后,提出一种更少步数的外观蒸馏策略,以消除去噪过程中的外观冗余,大幅提升推理效率。最后,我们引入一种配备滑动训练策略和历史关键帧机制的自回归微块流式生成范式,以实现低延迟和稳定的长视频生成。大量实验表明,PersonaLive 实现了最先进的性能,相比先前的基于扩散模型的人物肖像动画模型提速高达 7-22 倍。
引用
@article{arxiv.2512.11253,
title = {PersonaLive! Expressive Portrait Image Animation for Live Streaming},
author = {Zhiyuan Li and Chi-Man Pun and Chen Fang and Jue Wang and Xiaodong Cun},
journal= {arXiv preprint arXiv:2512.11253},
year = {2025}
}