面向真实场景中任意说话人的唇语转语音合成
计算机视觉与模式识别
2022-09-02 v1 计算与语言
声音
音频与语音处理
摘要
在这项工作中,我们解决了从无声唇部视频为真实场景中任意说话人生成语音的问题。与以往工作形成鲜明对比的是,我们的方法(i)不局限于固定数量的说话人,(ii)不对领域或词汇施加显式约束,以及(iii)处理的是在真实场景中而非实验室环境下录制的视频。该任务带来一系列挑战,其中关键之一是目标语音的许多特征(如音色、音高和语言内容)无法完全从无声音频面部视频中推断出来。为了处理这些随机变化,我们提出了一种新的 VAE-GAN 架构,学习在变化中建立唇部与语音序列的关联。借助多个强大的判别器引导训练过程,我们的生成器学会为任意人的唇部运动以任意音色合成语音序列。在多个数据集上的大量实验表明,我们以大幅优势优于所有基线方法。此外,我们的网络可在特定身份的视频上进行微调,以达到与使用 更多数据训练的单说话人模型相媲美的性能。我们进行了大量消融实验以分析架构中不同模块的影响。我们还提供了一个演示视频,展示了若干定性结果,并在我们的网站上公开了代码和训练好的模型:\url{http://cvit.iiit.ac.in/research/projects/cvit-projects/lip-to-speech-synthesis}
引用
@article{arxiv.2209.00642,
title = {Lip-to-Speech Synthesis for Arbitrary Speakers in the Wild},
author = {Sindhu B Hegde and K R Prajwal and Rudrabha Mukhopadhyay and Vinay P Namboodiri and C. V. Jawahar},
journal= {arXiv preprint arXiv:2209.00642},
year = {2022}
}
备注
Accepted in ACM-MM 2022, 9 pages, 2 pages supplementary, 7 Figures