用于语音到人脸生成的基于注意力的残差语音肖像模型
计算机视觉与模式识别
2020-07-10 v1 机器学习
图像与视频处理
摘要
给定说话人的语音,探讨是否能生成该说话人的面孔是一件有趣的事。该任务的一个主要挑战是缓解人脸与语音之间的自然不匹配。为此,在本文中,我们通过将残差的思想引入混合编码器-解码器架构,提出了一种新颖的基于注意力的残差语音肖像模型,其中人脸先验特征与语音编码器的输出融合以形成最终的人脸特征。特别地,我们创新性地建立了一个由 L2 范数、L1 范数和负余弦损失的加权线性组合构成的三项损失函数,通过比较最终人脸特征与真实人脸特征来训练我们的模型。在 AVSpeech 数据集上的评估表明,我们提出的模型加速了训练的收敛,在生成人脸的质量上超越了 SOTA,并且与真实值相比实现了更优的性别和年龄识别准确率。
引用
@article{arxiv.2007.04536,
title = {Attention-based Residual Speech Portrait Model for Speech to Face Generation},
author = {Jianrong Wang and Xiaosheng Hu and Li Liu and Wei Liu and Mei Yu and Tianyi Xu},
journal= {arXiv preprint arXiv:2007.04536},
year = {2020}
}