中文

情绪可控的泛化说话人脸生成

计算机视觉与模式识别 2022-05-04 v1 机器学习 多媒体

摘要

尽管近年来取得显著进展,极少数基于 AI 的说话人脸生成方法尝试渲染自然情绪。此外,这些方法的范围主要受限于训练数据集的特性,因而无法泛化到任意未见人脸。本文提出一种单次、面部几何感知的情绪说话人脸生成方法,可泛化到任意人脸。我们提出图卷积神经网络,利用语音内容特征与独立的情绪输入,在面部几何感知关键点表示上生成情绪与语音诱导的运动。该表示进一步用于我们光流引导的纹理生成网络以产生纹理。我们提出双分支纹理生成网络,运动与纹理分支分别独立考虑运动与纹理内容。相较先前情绪说话人脸方法,我们的方法可通过仅用目标身份中性情绪的单张图像微调,适应野外捕获的任意人脸。

关键词

引用

@article{arxiv.2205.01155,
  title  = {Emotion-Controllable Generalized Talking Face Generation},
  author = {Sanjana Sinha and Sandika Biswas and Ravindra Yadav and Brojeshwar Bhowmick},
  journal= {arXiv preprint arXiv:2205.01155},
  year   = {2022}
}

备注

Accepted at IJCAI 2022