DEX-TTS:基于时间可变性的扩散式表达文本语音合成
音频与语音处理
2024-06-28 v1 人工智能
摘要
基于参考语音的表达文本语音合成 (TTS) 已被广泛研究,以合成自然语音,但存在获取良好风格表示和提高模型泛化能力的局限。本研究提出一种基于扩散的表达文本语音合成 (DEX-TTS),这是一种用于参考语音合成的声学模型,具有增强的风格表示。基于通用的扩散 TTS 框架,DEX-TTS 包括编码器和适配器来处理从参考语音中提取的风格。关键创新包括将风格区分为时间不变和时间可变类别以实现有效的风格提取,以及设计具有高泛化能力的编码器和适配器。此外,我们引入重叠 patchify 和卷积频率 patch 嵌入策略以提高面向语音的扩散网络 (DiT) 的性能。DEX-TTS 在英语多说话人和情感多说话人数据集上在客观和主观评估方面表现出色,无需依赖预训练策略。最后,与单说话人数据集上的通用 TTS 结果比较验证了我们增强扩散主干的有效性。演示可在此处获取。
引用
@article{arxiv.2406.19135,
title = {DEX-TTS: Diffusion-based EXpressive Text-to-Speech with Style Modeling on Time Variability},
author = {Hyun Joon Park and Jin Sob Kim and Wooseok Shin and Sung Won Han},
journal= {arXiv preprint arXiv:2406.19135},
year = {2024}
}
备注
Preprint