VECL-TTS:基于语音身份与情感风格可控的跨语言文本转语音
音频与语音处理
2024-06-13 v1 声音
摘要
尽管文本转语音(TTS)系统取得了显著进展,但其在自动配音中的完全利用仍受限。此任务要求从源语言中提取参考语音的语音身份与情感风格,并通过跨语言TTS技术将其传递到目标语言。虽然前期方法主要致力于控制跨语言TTS框架内的语音身份,但关于同时融合情感与语音身份的工作仍有限。为此,我们引入了一个基于多语言说话人和情感嵌入网络的端到端语音身份与情感风格可控跨语言(VECL)TTS系统。此外,我们引入内容与风格一致性损失,以进一步提升合成语音质量。该系统在由英语及三种印度语言(Hindi、Telugu、Marathi)组成的数据库上,相较于最先进(SOTA)方法实现了平均8.83%的相对提升。
引用
@article{arxiv.2406.08076,
title = {VECL-TTS: Voice identity and Emotional style controllable Cross-Lingual Text-to-Speech},
author = {Ashishkumar Gudmalwar and Nirmesh Shah and Sai Akarsh and Pankaj Wasnik and Rajiv Ratn Shah},
journal= {arXiv preprint arXiv:2406.08076},
year = {2024}
}
备注
Accepted at INTERSPEECH 2024