语音合成系统及媒体应用综述
音频与语音处理
2023-10-24 v1 声音
摘要
生成类似于人声的合成语音,是现代交互媒体系统新兴的新奇事物。文本转语音(TTS)系统试图通过文本输入生成合成且真实的语音。此外,众所周知且熟悉的配音、播报与旁白声音,作为任何媒体组织的宝贵资产,可借助 TTS 与语音转换(VC)算法永久保存。深度学习方法的出现使此类 TTS 系统更加准确且易用。为更好理解 TTS 系统,本文调研了此类系统的关键组件,包括文本分析、声学建模与声码器。随后详述了基于深度学习的重要 SOTA TTS 系统。最后,近期发布的系统在骨干架构、输入与转换类型、所用声码器及主观评估(MOS)方面进行了比较。相应地,Tacotron 2、Transformer TTS、WaveNet 与 FastSpeech 1 属于迄今最成功的 TTS 系统。在讨论部分,就预期应用给出了开发 TTS 系统的若干建议。
引用
@article{arxiv.2310.14301,
title = {An overview of text-to-speech systems and media applications},
author = {Mohammad Reza Hasanabadi},
journal= {arXiv preprint arXiv:2310.14301},
year = {2023}
}
备注
Accepted in ABU Technical Review journal 2023/6