中文

MoEE: 面向音频驱动肖像动画的情感专家混合

计算机视觉与模式识别 2025-01-10 v2

摘要

说话虚拟形象的生成在精确音频同步方面已取得显著进展。然而,制作逼真的说话人脸视频需要捕捉广泛的情绪与细微的面部表情。当前方法面临根本性挑战:a) 缺乏用于建模单一基本情绪表情的框架,这限制了复合情绪等复杂情绪的生成;b) 缺乏富含人类情绪表情的综合性数据集,这限制了模型的潜力。为应对这些挑战,我们提出以下创新:1) 情感专家混合模型,将六种基本情绪解耦,以实现单一与复合情绪状态的精确合成;2) DH-FaceEmoVid-150 数据集,专门策划以包含六种常见人类情绪表情及四种复合情绪,从而扩展情绪驱动模型的训练潜力。此外,为增强情绪控制的灵活性,我们提出一个 emotion-to-latents 模块,利用多模态输入,对齐音频、文本和标签等多样化控制信号,以确保更丰富的控制输入,并具备仅使用音频控制情绪的能力。通过广泛的定量与定性评估,我们证明 MoEE 框架结合 DH-FaceEmoVid-150 数据集,在生成复杂情绪表情与细腻面部细节方面表现卓越,为该领域树立了新的基准。这些数据集将公开发布。

关键词

引用

@article{arxiv.2501.01808,
  title  = {MoEE: Mixture of Emotion Experts for Audio-Driven Portrait Animation},
  author = {Huaize Liu and Wenzhang Sun and Donglin Di and Shibo Sun and Jiahui Yang and Changqing Zou and Hujun Bao},
  journal= {arXiv preprint arXiv:2501.01808},
  year   = {2025}
}