EmoSSLSphere:基于球面向量和离散语音标记的多语言情感语音合成
音频与语音处理
2025-10-07 v2
摘要
本文介绍了 EmoSSLSphere,一个用于多语言情感文本转语音(TTS)合成的新型框架,结合了球面情感向量与来自自监督学习(SSL)的离散语音标记。通过将情感编码在连续的球面坐标空间中,并利用 SSL 表示进行语义和声学建模,EmoSSLSphere 实现了细粒度的情感控制、有效的跨语言情感迁移以及对说话人身份的稳健保留。我们在英语和日文语料库上评估了 EmoSSLSphere,证明了其在语音可理解性、频谱保真度、韵律一致性和整体合成质量方面的显著提升。主观评估进一步确认,我们的方法在自然度和情感表达方面优于基线模型,凸显了其作为可扩展的多语言情感 TTS 解决方案的潜力。
引用
@article{arxiv.2508.11273,
title = {EmoSSLSphere: Multilingual Emotional Speech Synthesis with Spherical Vectors and Discrete Speech Tokens},
author = {Joonyong Park and Kenichi Nakamura},
journal= {arXiv preprint arXiv:2508.11273},
year = {2025}
}
备注
In Proceedings of the 13th ISCA Speech Synthesis Workshop