Playmate:基于3D隐式空间引导扩散的头像动画灵活控制
计算机视觉与模式识别
2025-10-16 v3
摘要
最近的基于扩散的说话人脸生成模型在准确匹配给定参考身份与语音音频的合成视频方面展现出惊人的潜力。然而,现有方法仍面临诸多挑战,包括lip-sync不准、头部姿态不恰当以及对面部表情缺乏精细控制。为引入更多基于脸部的控制条件,超越语音音频片段,本文提出一种新的两阶段训练框架Playmate,以生成更自然的面部表情和说话人脸。在第一阶段,我们引入解耦的3D隐式表示,并设计严密的运动解耦模块,以实现更精准的属性解耦,直接从音频线索生成生动的说话视频。在第二阶段,我们引入情绪控制模块,将情绪控制信息编码到潜在空间,从而实现对情绪的精细控制,实现生成具有所需情绪的说话视频。广泛的实验结果表明,Playmate不仅在视频质量方面超越了现有最先进的方法,在lip-sync同步性方面表现出强大的竞争力,同时在控制情绪和头部姿态方面提供了更好的灵活性。代码将公开于https://github.com/Playmate111/Playmate。
引用
@article{arxiv.2502.07203,
title = {Playmate: Flexible Control of Portrait Animation via 3D-Implicit Space Guided Diffusion},
author = {Xingpei Ma and Jiaran Cai and Yuansheng Guan and Shenneng Huang and Qiang Zhang and Shunsi Zhang},
journal= {arXiv preprint arXiv:2502.07203},
year = {2025}
}