评估并缩减合成语音与真实语音分布之间的距离
音频与语音处理
2023-05-26 v2 计算与语言
机器学习
声音
摘要
尽管现代文本到语音(TTS)系统能生成自然听感的语音,它们仍无法复现自然语音数据中的全部多样性。我们考虑这些说话人可能生成的所有真实语音样本的分布,以及使用特定 TTS 系统为同一组说话人可能生成的所有合成样本的分布。我们着手通过一系列与说话人属性、语音韵律和声学环境相关的语句级统计量来量化真实与合成语音之间的距离。这些统计量分布的差异使用 Wasserstein 距离评估。我们通过在生成时提供真值来缩减这些距离,并量化使用自动语音识别系统近似的整体分布距离的改进。我们的最佳系统实现了分布距离 10% 的缩减。
引用
@article{arxiv.2211.16049,
title = {Evaluating and reducing the distance between synthetic and real speech distributions},
author = {Christoph Minixhofer and Ondřej Klejch and Peter Bell},
journal= {arXiv preprint arXiv:2211.16049},
year = {2023}
}
备注
To be presented at INTERSPEECH 2023