X-Actor:基于音频的情感与表现力长程肖像表演
计算机视觉与模式识别
2025-08-06 v1
摘要
我们提出了 X-Actor,一种新颖的音频驱动肖像动画框架,能够从单张参考图像和输入音频片段生成逼真且富有情感表现力的说话人脸视频。与先前在受限说话场景中强调唇部同步和短程视觉保真度的方法不同,X-Actor 实现了演员级别的长篇幅肖像表演,捕捉了与语音节奏和内容连贯流动的细腻且动态演变的情感。我们方法的核心是一个两阶段解耦生成流水线:一个基于音频条件的自回归扩散模型,在长时序上下文窗口内预测富有表现力但与身份无关的面部运动潜在 token;随后是一个基于扩散的视频合成模块,将这些运动转化为高保真视频动画。通过在与视觉和身份线索解耦的紧凑面部运动潜在空间中运作,我们的自回归扩散模型通过扩散强制训练范式有效捕捉了音频与面部动态之间的长程相关性,实现了无限长且情感丰富的运动预测,且无误差累积。大量实验表明,X-Actor 生成了超越标准说话人脸动画的引人入胜的电影级表演,并在长程、音频驱动的情感肖像表演中取得了 SOTA 结果。
引用
@article{arxiv.2508.02944,
title = {X-Actor: Emotional and Expressive Long-Range Portrait Acting from Audio},
author = {Chenxu Zhang and Zenan Li and Hongyi Xu and You Xie and Xiaochen Zhao and Tianpei Gu and Guoxian Song and Xin Chen and Chao Liang and Jianwen Jiang and Linjie Luo},
journal= {arXiv preprint arXiv:2508.02944},
year = {2025}
}
备注
Project Page at https://byteaigc.github.io/X-Actor/