中文

面向低资源场景下离线 on-device 应用的轻量级端到端文本语音合成

声音 2025-11-25 v1 人工智能 音频与语音处理

摘要

最近的研究表明,直接以原始波形形式从文本进行端到端(E2E)建模可产生比传统基于级联或两阶段方法的神经文本语音合成(TTS)系统更自然的语音。然而,当前的 E2E 最先进模型计算复杂且占用大量内存,难以适用于低资源场景下的实时离线 on-device 应用。为此,我们提出了轻量级 E2E-TTS(LE2E)模型,能够在最小化计算资源需求下生成高质量语音。我们在 LJSpeech 数据集上对所提出的模型进行评估,表明其在实现最先进性能的同时,模型参数规模可缩小至 90%,实时因子提升约 10 倍。此外,我们展示的 E2E 训练范式在质量上优于等效架构的两阶段训练方法。我们的结果表明,LE2E 是面向 on-device 应用开发实时、高质量、低资源 TTS 应用的有前景的方案。

关键词

引用

@article{arxiv.2505.07701,
  title  = {Lightweight End-to-end Text-to-speech Synthesis for low resource on-device applications},
  author = {Biel Tura Vecino and Adam Gabryś and Daniel Mątwicki and Andrzej Pomirski and Tom Iddon and Marius Cotescu and Jaime Lorenzo-Trueba},
  journal= {arXiv preprint arXiv:2505.07701},
  year   = {2025}
}

备注

Published as a conference paper at SSW 2023