中文

基于推测解码的快速高质量自回归语音合成

音频与语音处理 2025-02-11 v2 人工智能 声音

摘要

自回归架构(如 GPT)广泛应用于现代文本到语音(TTS)系统。然而,它会导致大量的推理时间,特别是由于长序列语音令牌带来的下一个令牌预测挑战。在这项工作中,我们引入了 VADUSA,这是通过推测解码加速自回归 TTS 的首批方法之一。我们的结果表明,VADUSA 不仅显著提高了推理速度,还通过引入草稿头来自回归地预测未来语音内容,从而提升了性能。此外,在采样过程中加入容错机制可在不降低质量的情况下加速推理。我们的方法在大型数据集和各种类型的语音令牌上展现了强大的泛化能力。

关键词

引用

@article{arxiv.2410.21951,
  title  = {Fast and High-Quality Auto-Regressive Speech Synthesis via Speculative Decoding},
  author = {Bohan Li and Hankun Wang and Situo Zhang and Yiwei Guo and Kai Yu},
  journal= {arXiv preprint arXiv:2410.21951},
  year   = {2025}
}

备注

Accepted by ICASSP 2025