基于时空卷积GAN的人脸表情视频生成:FEV-GAN
计算机视觉与模式识别
2023-07-04 v1
摘要
人脸表情生成一直是全球科学家和研究者感兴趣的任务。在此背景下,我们提出了一种生成六种基本面部表情视频的新方法。从一张中性人脸图像和一个指示所需面部表情的标签出发,我们旨在合成给定身份执行指定面部表情的视频。我们的方法称为 FEV-GAN(Facial Expression Video GAN,人脸表情视频GAN),基于时空卷积GAN(Spatio-temporal Convolutional GAN),这类网络已知能在同一网络中同时建模内容与运动。此前基于此类网络的方法已展现出生成具有平滑时间演化的连贯视频的良好能力,但仍存在图像质量低和身份保持能力弱的问题。本工作中,我们通过使用由两个不同的图像编码器组成的生成器来解决该问题:第一个预训练用于人脸身份特征提取,第二个用于空间特征提取。我们在两个国际面部表情基准数据库 MUG 和 Oulu-CASIA NIR&VIS 上对我们的模型进行了定性与定量评估。实验结果分析表明,我们的方法在生成六种基本面部表情视频的同时能有效保持输入身份。分析还证明,同时使用身份与空间特征增强了解码器更好地保持身份并生成高质量视频的能力。代码与预训练模型将很快公开。
引用
@article{arxiv.2210.11182,
title = {Facial Expression Video Generation Based-On Spatio-temporal Convolutional GAN: FEV-GAN},
author = {Hamza Bouzid and Lahoucine Ballihi},
journal= {arXiv preprint arXiv:2210.11182},
year = {2023}
}
备注
13 pages, 8 figures, accepted in ISWA journal