中文

LightGrad:面向文本转语音的轻量级扩散概率模型

声音 2023-09-01 v1 音频与语音处理

摘要

神经文本转语音(TTS)模型的最新进展将数千种 TTS 应用带入日常生活,模型部署在云端为用户提供服务。这些模型中包含扩散概率模型(DPMs),与其他生成模型相比,其可稳定训练且参数更高效。由于用户与云端之间传输数据会引入高延迟和暴露隐私数据的风险,将 TTS 模型部署在边缘设备上是更优选择。将 DPM 实现到边缘设备时存在两个实际问题。首先,当前 DPM 对资源受限设备而言不够轻量。其次,DPM 在推理中需要许多去噪步骤,增加了延迟。在这项工作中,我们提出 LightGrad,一种用于 TTS 的轻量级 DPM。LightGrad 配备轻量级 U-Net 扩散解码器和免训练快速采样技术,减少了模型参数和推理延迟。LightGrad 还实现了流式推理以进一步降低延迟。与 Grad-TTS 相比,LightGrad 在 4 个去噪步骤下,参数减少 62.2%,延迟减少 65.7%,同时在汉语普通话和英语上保持可比的语音质量。

关键词

引用

@article{arxiv.2308.16569,
  title  = {LightGrad: Lightweight Diffusion Probabilistic Model for Text-to-Speech},
  author = {Jie Chen and Xingchen Song and Zhendong Peng and Binbin Zhang and Fuping Pan and Zhiyong Wu},
  journal= {arXiv preprint arXiv:2308.16569},
  year   = {2023}
}

备注

Accepted by ICASSP 2023