情感增强的说话人脸生成
计算机视觉与模式识别
2023-03-28 v2
摘要
已有若干工作开发了端到端的唇形同步说话人脸生成流水线,可用于教学、视频语言翻译等多种实际应用。然而,这些先前的工作未能生成逼真外观的视频,因为它们很少关注人的表情与情感。此外,这些方法的有效性很大程度上依赖于训练数据集中的人脸,这意味着它们可能在未见过的人脸上表现不佳。为缓解此问题,我们构建了一个以类别化情感为条件的说话人脸生成框架,以生成带有恰当表情的视频,使其更真实且令人信服。借助广泛的六种情感,即快乐、悲伤、恐惧、愤怒、厌恶和中性,我们展示了我们的模型可适配任意身份、情感与语言。我们提出的框架配备了一个用户友好的网页界面,提供带情感的说话人脸生成的实时体验。我们还开展了一项用户研究,以主观评估我们界面在可用性、设计和功能方面的表现。项目主页:https://midas.iiitd.edu.in/emo/
引用
@article{arxiv.2303.11548,
title = {Emotionally Enhanced Talking Face Generation},
author = {Sahil Goyal and Shagun Uppal and Sarthak Bhagat and Yi Yu and Yifang Yin and Rajiv Ratn Shah},
journal= {arXiv preprint arXiv:2303.11548},
year = {2023}
}