基于多样性的文本到语音核心集选取:结合语言与声学特征
声音
2023-09-18 v1 音频与语音处理
摘要
本文提出一种从文本到语音(TTS)语料库中提取轻量子集并保证合成语音质量的方法。近年来,已有方法通过从有声读物和 YouTube 等海量来源收集多样数据来构建大规模 TTS 语料库。尽管这些方法因增强 TTS 系统表现力而备受关注,但它们往往优先收集大量数据,未考虑存储容量与训练计算时间等实际约束,从而限制了可用数据量。因此,需要在这些体量约束下高效收集数据。为此,我们提出一种基于“多样性度量”(衡量子集涵盖范围广度的指标)从 TTS 语料库选取核心子集(即 core-set)的方法。实验结果表明,我们所提方法在跨语言与语料库规模上均显著优于基于音素平衡的数据选取基线。
引用
@article{arxiv.2309.08127,
title = {Diversity-based core-set selection for text-to-speech with linguistic and acoustic features},
author = {Kentaro Seki and Shinnosuke Takamichi and Takaaki Saeki and Hiroshi Saruwatari},
journal= {arXiv preprint arXiv:2309.08127},
year = {2023}
}