情绪可控的泛化说话人脸生成
计算机视觉与模式识别
2022-05-04 v1 机器学习
多媒体
摘要
尽管近年来取得显著进展,极少数基于 AI 的说话人脸生成方法尝试渲染自然情绪。此外,这些方法的范围主要受限于训练数据集的特性,因而无法泛化到任意未见人脸。本文提出一种单次、面部几何感知的情绪说话人脸生成方法,可泛化到任意人脸。我们提出图卷积神经网络,利用语音内容特征与独立的情绪输入,在面部几何感知关键点表示上生成情绪与语音诱导的运动。该表示进一步用于我们光流引导的纹理生成网络以产生纹理。我们提出双分支纹理生成网络,运动与纹理分支分别独立考虑运动与纹理内容。相较先前情绪说话人脸方法,我们的方法可通过仅用目标身份中性情绪的单张图像微调,适应野外捕获的任意人脸。
引用
@article{arxiv.2205.01155,
title = {Emotion-Controllable Generalized Talking Face Generation},
author = {Sanjana Sinha and Sandika Biswas and Ravindra Yadav and Brojeshwar Bhowmick},
journal= {arXiv preprint arXiv:2205.01155},
year = {2022}
}
备注
Accepted at IJCAI 2022