基于扩散的 TTS 模型适应性研究
音频与语音处理
2023-03-06 v1 声音
摘要
鉴于扩散在生成自然 sounding 合成语音方面近期的成功,我们研究如何将扩散用于说话人自适应 TTS。借鉴更传统的自适应方法,我们展示了可使用带步嵌入的条件层归一化将自适应纳入扩散流水线。然而,我们通过实验表明,尽管该方法有其价值,但仅此自适应无法接近基于 Transformer 的技术的性能。在第二项实验中,我们展示扩散可与 Transformer 最优结合,后者承担大部分自适应负载,前者有助于提升自然度。
引用
@article{arxiv.2303.01849,
title = {An investigation into the adaptability of a diffusion-based TTS model},
author = {Haolin Chen and Philip N. Garner},
journal= {arXiv preprint arXiv:2303.01849},
year = {2023}
}