中文

DeviceTTS:一种用于端侧文本转语音的小 footprint、快速、稳定网络

音频与语音处理 2021-01-18 v2 声音

摘要

随着智能设备数量的增加,对端侧文本转语音(TTS)的需求迅速增长。近年来,许多杰出的端到端TTS方法被提出,极大提升了合成语音的质量。然而,为保证语音合格,大多数TTS系统依赖于庞大而复杂的神经网络模型,难以将这些TTS系统部署到端侧。本文提出一种用于端侧TTS的小 footprint、快速、稳定网络,命名为DeviceTTS。DeviceTTS利用时长预测器作为编码器与解码器之间的桥梁,从而避免Tacotron中字词跳过与重复的问题。众所周知,模型大小是端侧TTS的关键因素。对于DeviceTTS,采用深度前馈序列记忆网络(DFSMN)作为基本组件。此外,为加速推理,提出混合分辨率解码器以平衡推理速度与语音质量。实验使用WORLD和LPCNet声码器完成。最终,仅用140万模型参数和0.099 GFLOPS,DeviceTTS取得了与Tacotron和FastSpeech相当的性能。据我们所知,DeviceTTS能满足实际应用中大多数设备的需求。

关键词

引用

@article{arxiv.2010.15311,
  title  = {DeviceTTS: A Small-Footprint, Fast, Stable Network for On-Device Text-to-Speech},
  author = {Zhiying Huang and Hao Li and Ming Lei},
  journal= {arXiv preprint arXiv:2010.15311},
  year   = {2021}
}

备注

5 pages, 1 figure, Submitted to ICASSP2021