基于单图像与情感条件的语音驱动说话人脸生成
音频与语音处理
2021-07-23 v2 计算机视觉与模式识别
机器学习
多媒体
摘要
视觉情感表达在视听语音交流中起着重要作用。本工作中,我们提出一种在语音驱动说话人脸生成中渲染视觉情感表达的新方法。具体而言,我们设计了一个端到端说话人脸生成系统,以语音片段、单张人脸图像和类别情感标签为输入,渲染与语音同步且表达所给条件情感的说话人脸视频。在图像质量、视听同步性和视觉情感表达上的客观评测表明,所提系统优于最先进的基线系统。对视觉情感表达与视频真实感的主观评测亦证明了所提系统的优越性。此外,我们利用音频与视觉模态间情感不匹配的生成视频开展了一项人类情感识别初步研究。结果表明,在此任务上人类对视觉模态的响应显著强于音频模态。
引用
@article{arxiv.2008.03592,
title = {Speech Driven Talking Face Generation from a Single Image and an Emotion Condition},
author = {Sefik Emre Eskimez and You Zhang and Zhiyao Duan},
journal= {arXiv preprint arXiv:2008.03592},
year = {2021}
}
备注
Accepted to IEEE Transactions on Multimedia