中文

ECTSpeech:通过简易一致性调优提升高效语音合成

声音 2025-10-08 v1 人工智能 音频与语音处理

摘要

扩散模型在语音合成中已展现出显著性能,但通常需要多步采样,导致推理效率低下。近期研究通过将扩散模型蒸馏为一致性模型来解决此问题,实现高效的单步生成。然而,这些方法引入了额外的训练成本,且严重依赖预训练教师模型的性能。本文提出 ECTSpeech,一个简单而高效的单步语音合成框架,首次将简易一致性调优(ECT)策略引入语音合成。通过逐步收紧预训练扩散模型上的一致性约束,ECTSpeech 在显著降低训练复杂度的同时实现了高质量的单步生成。此外,我们设计了一个多尺度门控模块(MSGate)以增强去噪器融合多尺度特征的能力。在 LJSpeech 数据集上的实验结果表明,ECTSpeech 在单步采样下达到了与最先进方法相当的音频质量,同时大幅降低了模型的训练成本和复杂度。

关键词

引用

@article{arxiv.2510.05984,
  title  = {ECTSpeech: Enhancing Efficient Speech Synthesis via Easy Consistency Tuning},
  author = {Tao Zhu and Yinfeng Yu and Liejun Wang and Fuchun Sun and Wendong Zheng},
  journal= {arXiv preprint arXiv:2510.05984},
  year   = {2025}
}

备注

Accepted for publication by Proceedings of the 2025 ACM Multimedia Asia Conference(MMAsia '25)