中文

面向低成本文本到语音系统的神经后滤波器的合成与自然人声失配循环精修方法

音频与语音处理 2022-09-28 v1 声音

摘要

基于神经网络的文本到语音(TTS)系统因神经网络的快速发展而实现了极高保真度的语音生成。然而,庞大的标注语料与高计算成本要求限制了小公司或个人开发高保真 TTS 系统的可能性。另一方面,已被广泛采用于神经 TTS 系统语音生成的神经声码器,可用相对较小的无标注语料训练。因此,本文探索一种通用框架,利用神经声码器为低成本 TTS 系统开发神经后滤波器(NPF)。提出一种循环方法以应对开发 NPF 时的声学与时序失配(AM 与 TM)。我们开展了客观与主观评测,以证明 AM 与 TM 问题及所提框架的有效性。

关键词

引用

@article{arxiv.2207.05913,
  title  = {A Cyclical Approach to Synthetic and Natural Speech Mismatch Refinement of Neural Post-filter for Low-cost Text-to-speech System},
  author = {Yi-Chiao Wu and Patrick Lumban Tobing and Kazuki Yasuhara and Noriyuki Matsunaga and Yamato Ohtani and Tomoki Toda},
  journal= {arXiv preprint arXiv:2207.05913},
  year   = {2022}
}

备注

15 pages, 7 figures, 10 tables