中文

EMOdiffhead:通过扩散实现讲话人生成的持续情感控制

计算机视觉与模式识别 2024-09-12 v1

摘要

音频驱动的肖像动画任务涉及使用身份图像和语音轨道生成讲话人视频。虽然许多现有方法关注lip synchronization 和 video quality,但很少有方法解决生成情感驱动的讲话人视频的挑战。能够控制和编辑情感对于产生富有表现力和真实感的动画至关重要。针对这一挑战,我们提出了 EMOdiffhead,这是一种新的情感讲话人视频生成方法,不仅能够实现情感类别和强度的细粒度控制,而且能够实现 one-shot 生成。鉴于 FLAME 3D 模型在表达建模中的线性特性,我们利用 DECA 方法提取表达向量,将其与音频结合以指导扩散模型生成具有精确 lip synchronization 和丰富情感表达的视频。该方法不仅能够从情感无关数据中学习丰富的面部信息,还促进了情感视频的生成。它有效地克服了情感数据稀缺(如面部和背景信息的缺乏多样性)的问题,以及情感无关数据中缺乏情感细节的限制。通过大量实验和用户研究,我们的方法在其他情感肖像动画方法中实现了 state-of-the-art performance。

关键词

引用

@article{arxiv.2409.07255,
  title  = {EMOdiffhead: Continuously Emotional Control in Talking Head Generation via Diffusion},
  author = {Jian Zhang and Weijian Mai and Zhijun Zhang},
  journal= {arXiv preprint arXiv:2409.07255},
  year   = {2024}
}

备注

12 pages, 7 figures