SVTS:可扩展的视频到语音合成
声音
2022-08-17 v2 计算机视觉与模式识别
机器学习
音频与语音处理
摘要
视频到语音合成(亦称唇语到语音)是指将无声的唇部运动转换为相应音频。该任务因其自监督特性(即无需人工标注即可训练)加之网上日益增长的视听数据收集而受到越来越多的关注。尽管有这些强劲动机,当代视频到语音工作主要聚焦于具有显著词汇与场景限制的中小型语料库。在本工作中,我们引入一个可扩展的视频到语音框架,其由两个组件构成:视频到频谱图预测器与预训练的神经网络声码器,后者将梅尔频率频谱图转换为波形音频。我们在GRID上取得了最先进的结果,并在LRW上大幅优于先前方法。更重要的是,通过聚焦于使用简单前馈模型进行频谱图预测,我们能够高效且有效地将方法扩展到极大型无约束数据集:据我们所知,我们首次在具挑战性的LRS3数据集上展示了可懂度结果。
引用
@article{arxiv.2205.02058,
title = {SVTS: Scalable Video-to-Speech Synthesis},
author = {Rodrigo Mira and Alexandros Haliassos and Stavros Petridis and Björn W. Schuller and Maja Pantic},
journal= {arXiv preprint arXiv:2205.02058},
year = {2022}
}
备注
accepted to INTERSPEECH 2022 (Oral Presentation)