LightSpeech:基于神经架构搜索的轻量快速文本到语音系统
声音
2021-02-09 v1 人工智能
机器学习
音频与语音处理
摘要
文本到语音 (TTS) 已广泛用于在不同场景中合成自然且清晰的语音。将 TTS 部署于手机或嵌入式设备等各类终端设备上需要极小的内存占用和推理延迟。尽管非自回归 TTS 模型如 FastSpeech 已实现比自回归模型显著更快的推理速度,其模型大小和推理延迟对于资源受限设备上的部署仍显过大。本文中,我们提出 LightSpeech,其利用神经架构搜索 (NAS) 基于 FastSpeech 自动设计更轻量且高效的模型。我们首先剖析当前 FastSpeech 模型的组件,并精心设计一个包含多种轻量且潜在有效架构的新颖搜索空间。随后利用 NAS 在搜索空间内自动发现性能良好的架构。实验表明,我们的方法发现的模型在 CPU 上实现了 15 倍模型压缩比和 6.5 倍推理加速,且语音质量相当。音频演示见 https://speechresearch.github.io/lightspeech。
引用
@article{arxiv.2102.04040,
title = {LightSpeech: Lightweight and Fast Text to Speech with Neural Architecture Search},
author = {Renqian Luo and Xu Tan and Rui Wang and Tao Qin and Jinzhu Li and Sheng Zhao and Enhong Chen and Tie-Yan Liu},
journal= {arXiv preprint arXiv:2102.04040},
year = {2021}
}
备注
Accepted to ICASSP 21