DSE-TTS:用于跨语言语音合成的双说话人嵌入
声音
2023-06-27 v1 计算与语言
音频与语音处理
摘要
尽管语内语音合成可获得高保真语音,跨语言文本转语音(CTTS)仍远未令人满意,因其难以准确保留说话人音色(即说话人相似度)并消除其母语口音(即地道性)。本文证明了矢量量化(VQ)声学特征比梅尔谱图包含更少的说话人信息。基于该发现,我们提出一种新颖的双说话人嵌入 TTS(DSE-TTS)框架用于具有真实说话风格的 CTTS。其中,一个嵌入送入声学模型以学习语言说话风格,另一个嵌入集成至声码器以模仿目标说话人音色。实验表明,通过结合两种嵌入,DSE-TTS 在跨语言合成中显著优于最先进的 SANE-TTS,尤其在地道性方面。
引用
@article{arxiv.2306.14145,
title = {DSE-TTS: Dual Speaker Embedding for Cross-Lingual Text-to-Speech},
author = {Sen Liu and Yiwei Guo and Chenpeng Du and Xie Chen and Kai Yu},
journal= {arXiv preprint arXiv:2306.14145},
year = {2023}
}
备注
Accepted to Interspeech 2023