DMOSpeech:基于蒸馏扩散模型的零样图语音合成直接度量优化
音频与语音处理
2025-02-21 v2 人工智能
声音
摘要
扩散模型在语音合成任务中展现出巨大的潜力,包括文本到语音(TTS)和语音克隆。然而,其迭代去噪过程计算密集,之前的蒸馏尝试显示出一致的质量下降。此外,现有的 TTS 方法受限于非可微分组件或迭代采样,无法实现与感知度量的真正端到端优化。我们引入 DMOSpeech,一种蒸馏扩散-based TTS 模型,独特地实现了比其教师模型更快的推理速度和更佳性能。通过启用所有模型组件到所有模型组件的直接梯度路径,我们展示了在 TTS 中成功实现对可微分度量的端到端优化,纳入了连接时序分类(CTC)损失和说话人验证(SV)损失。我们的全面实验经广泛的人类评估验证,显示在自然性、可理解性和说话人相似性方面取得显著改进,同时将推理时间缩短了数量级。这一工作建立了一个新的框架,通过直接度量优化将语音合成与人类听觉偏好相匹配。音频样本可在 https://dmospeech.github.io/ 上获取。
引用
@article{arxiv.2410.11097,
title = {DMOSpeech: Direct Metric Optimization via Distilled Diffusion Model in Zero-Shot Speech Synthesis},
author = {Yingahao Aaron Li and Rithesh Kumar and Zeyu Jin},
journal= {arXiv preprint arXiv:2410.11097},
year = {2025}
}