MEDTalk:基于解缠嵌入的多模态控制 3D 面部动画,带动态情绪
计算机视觉与模式识别
2025-08-15 v4 多媒体
摘要
音频驱动的情感 3D 面部动画旨在生成同步的唇部动作和生动的面部表情。然而,现有大多数方法关注静态和预定义的情绪标签,限制了其多样性和自然性。为此,我们提出了 MEDTalk,一个用于精细且动态情感说话人脸生成的新框架。我们的方法首先通过精心设计的交叉重建过程,从动作序列中解缠内容和情绪嵌入空间,实现对唇部动作和面部表情的独立控制。除常规音频驱动的唇同步外,我们整合音频和语音文本,预测帧级强度变化,动态调整静态情绪特征以生成逼真的情感表情。此外,为增强控制和个性化,我们纳入多模态输入,包括文本描述和参考表情图像,以引导生成用户指定的面部表情。以 MetaHuman 为优先级,我们的生成结果可便捷地集成到工业生产管道中。代码地址:https://github.com/SJTU-Lucy/MEDTalk。
引用
@article{arxiv.2507.06071,
title = {MEDTalk: Multimodal Controlled 3D Facial Animation with Dynamic Emotions by Disentangled Embedding},
author = {Chang Liu and Ye Pan and Chenyang Ding and Susanto Rahardja and Xiaokang Yang},
journal= {arXiv preprint arXiv:2507.06071},
year = {2025}
}