中文

视听语音合成:简要文献综述

声音 2021-03-09 v1 计算机视觉与模式识别 机器学习 音频与语音处理 图像与视频处理

摘要

本简要文献综述研究视听语音合成问题,即给定文本作为输入生成动画说话头的问题。由于该问题高度复杂,我们将其视为两个子问题的组合。具体而言,即文本到语音(TTS)合成以及语音驱动的说话头动画。对于 TTS,我们介绍了用于将文本映射至中间声学表示(如梅尔频谱图)的模型,以及以这些中间表示为条件生成语音信号的模型(即声码器)。对于说话头动画问题,我们根据所生成的是人脸还是拟人形象对方法进行分类。并尝试讨论第二种情况下面部模型选择的重要性。在整个综述中,我们简要描述了视听语音合成中最重要的工作,力图凸显各种方法的优缺点。

关键词

引用

@article{arxiv.2103.03927,
  title  = {AudioVisual Speech Synthesis: A brief literature review},
  author = {Efthymios Georgiou and Athanasios Katsamanis},
  journal= {arXiv preprint arXiv:2103.03927},
  year   = {2021}
}

备注

review is written in Greek