DeviceTTS:一种用于端侧文本转语音的小 footprint、快速、稳定网络
音频与语音处理
2021-01-18 v2 声音
摘要
随着智能设备数量的增加,对端侧文本转语音(TTS)的需求迅速增长。近年来,许多杰出的端到端TTS方法被提出,极大提升了合成语音的质量。然而,为保证语音合格,大多数TTS系统依赖于庞大而复杂的神经网络模型,难以将这些TTS系统部署到端侧。本文提出一种用于端侧TTS的小 footprint、快速、稳定网络,命名为DeviceTTS。DeviceTTS利用时长预测器作为编码器与解码器之间的桥梁,从而避免Tacotron中字词跳过与重复的问题。众所周知,模型大小是端侧TTS的关键因素。对于DeviceTTS,采用深度前馈序列记忆网络(DFSMN)作为基本组件。此外,为加速推理,提出混合分辨率解码器以平衡推理速度与语音质量。实验使用WORLD和LPCNet声码器完成。最终,仅用140万模型参数和0.099 GFLOPS,DeviceTTS取得了与Tacotron和FastSpeech相当的性能。据我们所知,DeviceTTS能满足实际应用中大多数设备的需求。
引用
@article{arxiv.2010.15311,
title = {DeviceTTS: A Small-Footprint, Fast, Stable Network for On-Device Text-to-Speech},
author = {Zhiying Huang and Hao Li and Ming Lei},
journal= {arXiv preprint arXiv:2010.15311},
year = {2021}
}
备注
5 pages, 1 figure, Submitted to ICASSP2021