在文本到语音系统中构建合成说话人轮廓
音频与语音处理
2022-02-08 v1 声音
摘要
多说话人 TTS 系统中说话人轮廓的多样性是其性能的一个关键方面,因为它衡量了 TTS 系统可能合成多少种不同的说话人轮廓。然而,在构建多说话人 TTS 系统时,这一重要方面常被忽视,且尚无既定框架来评估该多样性。其原因在于大多数多说话人 TTS 系统仅限于生成与其训练数据相同说话人轮廓的语音信号。它们常使用离散说话人嵌入向量,这些向量与个体说话人一一对应。这种对应关系限制了 TTS 系统,并阻碍了其生成训练期间未出现过的未知说话人轮廓的能力。本文旨在构建具有更丰富说话人轮廓多样性、并能生成不同于训练数据的新合成说话人轮廓的多说话人 TTS 系统。为此,我们提出使用带有三元组损失和特定打乱机制的生成模型。在我们的实验中,所提方法在合成语音信号的区分度与可懂度两方面均展现出有效性与优势。
引用
@article{arxiv.2202.03125,
title = {Building Synthetic Speaker Profiles in Text-to-Speech Systems},
author = {Jie Pu and Yixiong Meng and Oguz Elibol},
journal= {arXiv preprint arXiv:2202.03125},
year = {2022}
}