EAMM:基于音频的情感感知运动模型实现单次情感说话人脸生成
计算机视觉与模式识别
2022-09-26 v3
摘要
尽管音频驱动的说话人脸生成已取得显著进展,现有方法要么忽略面部情感,要么无法应用于任意主体。本文提出情感感知运动模型(Emotion-Aware Motion Model, EAMM),通过引入情感源视频来生成单次情感说话人脸。具体而言,我们首先提出Audio2Facial-Dynamics模块,该模块由音频驱动的无监督零阶与一阶关键点运动渲染说话人脸。进而通过探索运动模型的特性,我们进一步提出隐式情感位移学习器,将情感相关面部动态表示为对先前所获运动表示的线性加性位移。综合实验表明,通过结合两模块的结果,我们的方法能在任意主体上生成具有真实情感模式的满意说话人脸结果。
引用
@article{arxiv.2205.15278,
title = {EAMM: One-Shot Emotional Talking Face via Audio-Based Emotion-Aware Motion Model},
author = {Xinya Ji and Hang Zhou and Kaisiyuan Wang and Qianyi Wu and Wayne Wu and Feng Xu and Xun Cao},
journal= {arXiv preprint arXiv:2205.15278},
year = {2022}
}
备注
Accepted by SIGGRAPH 2022 Conference Proceedings. For demo video and codes, see https://jixinya.github.io/projects/EAMM/