中文

基于运动先验条件扩散模型的长期说话人脸生成

计算机视觉与模式识别 2025-02-14 v1

摘要

近期条件扩散模型的进展在生成逼真的说话人脸视频方面展现了前景,但在实现长时间生成中保持一致的头部运动、同步的面部表情和准确的唇部同步方面仍面临挑战。为此,我们提出了运动先验条件扩散模型(MCDM),其利用存档和当前剪辑的运动先验以增强运动预测,确保时间一致性。该模型包含三个关键要素:(1)存档剪辑运动先验,整合历史帧和参考帧以保留身份和上下文;(2)当前剪辑运动先验扩散模型,捕获多模态因果性以准确预测头部运动、唇部同步和表情;(3)高效的时序注意力机制,通过动态存储和更新运动特征来缓解误差积累。我们还发布了名为 TalkingFace-Wild 的数据集,这是一个跨越 10 种语言、超过 200 小时的多语言说话人脸数据集。实验结果表明,MCDM 在维持身份和运动连续性方面对于长期说话人脸生成效果显著。代码、模型和数据集将公开提供。

关键词

引用

@article{arxiv.2502.09533,
  title  = {Long-Term TalkingFace Generation via Motion-Prior Conditional Diffusion Model},
  author = {Fei Shen and Cong Wang and Junyao Gao and Qin Guo and Jisheng Dang and Jinhui Tang and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2502.09533},
  year   = {2025}
}