DualSpeech:通过双分类自由指导增强说话人保真度和文本可理解性
音频与语音处理
2024-08-28 v2 声音
摘要
文本语音(TTS)模型取得了显著进展,旨在准确复制人类语言的多样性,包括独特的说话人身份和语言细微差别。尽管如此,在实现说话人保真度和文本可理解性之间取得最佳平衡仍然是一个挑战,尤其是在考虑多样化控制需求时。为此,我们引入DualSpeech,这是一种TTS模型,集成了音素级潜在扩散和双分类自由指导。这种方法实现了对说话人保真度和文本可理解性的卓越控制。实验结果表明,通过利用这种精细控制,DualSpeech在性能上超过了现有的SOTA TTS模型。演示可在 https://bit.ly/48Ewoib 访问。
引用
@article{arxiv.2408.14423,
title = {DualSpeech: Enhancing Speaker-Fidelity and Text-Intelligibility Through Dual Classifier-Free Guidance},
author = {Jinhyeok Yang and Junhyeok Lee and Hyeong-Seok Choi and Seunghun Ji and Hyeongju Kim and Juheon Lee},
journal= {arXiv preprint arXiv:2408.14423},
year = {2024}
}
备注
Accepted to INTERSPEECH 2024