中文

GPU上高效的增量式文本转语音

声音 2022-12-06 v2 机器学习 音频与语音处理

摘要

增量式文本转语音(incremental text-to-speech),亦称流式TTS,已越来越多地应用于需要超低响应延迟以提供最佳用户体验的在线语音应用。然而,大多数部署在GPU上的现有语音合成流水线仍为非增量式,这在高并发场景中暴露出局限性,尤其当流水线由端到端神经网络模型构建时。为解决此问题,我们提出一种在GPU上执行实时增量式TTS的高效方法,采用即时请求池化(Instant Request Pooling)与模块级动态批处理(Module-wise Dynamic Batching)。实验结果表明,所提方法能够在单块NVIDIA A10 GPU上、100 QPS下以低于80毫秒的首块延迟合成高质量语音,并在并发与延迟方面显著优于非增量式对应方案。我们的工作揭示了高性能增量式TTS在GPU上的有效性。

关键词

引用

@article{arxiv.2211.13939,
  title  = {Efficient Incremental Text-to-Speech on GPUs},
  author = {Muyang Du and Chuan Liu and Jiaxing Qi and Junjie Lai},
  journal= {arXiv preprint arXiv:2211.13939},
  year   = {2022}
}

备注

5 pages, 4 figures