CrossSpeech:面向跨语言语音合成的无说话人相关声学表征
声音
2023-06-13 v2 人工智能
音频与语音处理
信号处理
摘要
尽管近期文本到语音(TTS)系统已朝着人类水平质量取得显著进展,跨语言TTS的性能仍落后于语言内TTS。这一差距主要源于跨语言TTS中的说话人-语言纠缠问题。本文提出CrossSpeech,通过在声学特征空间层面有效解耦说话人与语言信息来提升跨语言语音质量。具体而言,CrossSpeech将语音生成流程分解为无说话人相关生成器(SIG)与有说话人相关生成器(SDG)。SIG生成不偏倚于特定说话人分布的无说话人相关声学表征。另一方面,SDG建模表征说话人属性的有说话人相关语音变化。通过分别处理各类信息,CrossSpeech可获得解耦的说话人与语言表征。实验表明,CrossSpeech在跨语言TTS上取得显著改进,尤其在朝向目标说话人的说话人相似度方面。
引用
@article{arxiv.2302.14370,
title = {CrossSpeech: Speaker-independent Acoustic Representation for Cross-lingual Speech Synthesis},
author = {Ji-Hoon Kim and Hong-Sun Yang and Yoon-Cheol Ju and Il-Hwan Kim and Byeong-Yeol Kim},
journal= {arXiv preprint arXiv:2302.14370},
year = {2023}
}
备注
Accepted to ICASSP 2023