语音合成中稀疏性、自然度、可懂度与韵律的相互作用
声音
2021-10-29 v2 计算与语言
音频与语音处理
摘要
端到端文本到语音(TTS)模型是否参数过剩?这些模型能在多大程度上被剪枝,其合成能力会发生什么变化?本工作作为探索谱图预测网络与声码器剪枝的起点。我们深入研究了稀疏性及其对合成语音后续影响的权衡。此外,我们探讨了 TTS 剪枝的若干方面:微调数据量与稀疏性的关系、利用未发音文本的 TTS 增强,以及知识蒸馏与剪枝的结合。我们的发现表明,端到端 TTS 模型不仅高度可剪枝,而且或许令人惊讶的是,剪枝后的 TTS 模型能够生成具有相等或更高自然度与可懂度、且韵律相似的合成语音。我们所有实验均在公开可用模型上进行,本工作的发现由大规模主观测试和客观度量支撑。代码与 200 个剪枝模型已公开以促进 TTS 效率的未来研究。
引用
@article{arxiv.2110.01147,
title = {On the Interplay Between Sparsity, Naturalness, Intelligibility, and Prosody in Speech Synthesis},
author = {Cheng-I Jeff Lai and Erica Cooper and Yang Zhang and Shiyu Chang and Kaizhi Qian and Yi-Lun Liao and Yung-Sung Chuang and Alexander H. Liu and Junichi Yamagishi and David Cox and James Glass},
journal= {arXiv preprint arXiv:2110.01147},
year = {2021}
}