基于视觉上下文注意力GAN的唇语到语音合成
计算机视觉与模式识别
2022-04-06 v1 人工智能
音频与语音处理
摘要
本文提出一种新颖的唇到语音生成对抗网络——视觉上下文注意力GAN(Visual Context Attentional GAN, VCA-GAN),可在语音合成过程中联合建模局部与全局唇部运动。具体而言,所提VCA-GAN通过寻找视位到音位的映射函数从局部唇部视觉特征合成语音,同时将全局视觉上下文嵌入生成器的中间层以澄清由同形异音引起的映射歧义。为此,提出一种视觉上下文注意力模块,该模块从局部视觉特征编码全局表征,并通过音视频注意力向生成器提供与给定粗粒度语音表征对应的所需全局视觉上下文。除显式建模局部与全局视觉表征外,还引入同步学习作为一种对比学习形式,引导生成器合成与给定输入唇部运动同步的语音。大量实验表明,所提VCA-GAN优于现有最先进方法,并能够有效从多说话人合成语音,而这是以往工作极少处理的。
引用
@article{arxiv.2204.01726,
title = {Lip to Speech Synthesis with Visual Context Attentional GAN},
author = {Minsu Kim and Joanna Hong and Yong Man Ro},
journal= {arXiv preprint arXiv:2204.01726},
year = {2022}
}
备注
Published at NeurIPS 2021