中文

我们能否使用 Common Voice 训练多说话人 TTS 系统?

音频与语音处理 2022-10-13 v1 声音

摘要

多说话人文本到语音(TTS)系统的训练依赖于基于高质量录音或有声书整理的精选数据集。此类数据集往往缺乏说话人多样性且收集成本高昂。作为替代,近期研究利用了大规模众包自动语音识别(ASR)数据集的可用性。此类数据集的一个主要问题是存在噪声和/或失真样本,会降低 TTS 质量。本文中,我们提出使用非侵入式平均意见得分(MOS)估计器 WV-MOS 自动筛选高质量训练样本。我们展示了该方法在 Common Voice 英文数据集上训练多说话人 GlowTTS 模型的可行性。相对于使用全部样本训练,我们的方法将生成语音的整体质量提升了 1.26 个 MOS 点;相对于在 LibriTTS 数据集上训练,提升了 0.35 个 MOS 点。这为面向更广泛语言的 TTS 数据集自动整理打开了大门。

关键词

引用

@article{arxiv.2210.06370,
  title  = {Can we use Common Voice to train a Multi-Speaker TTS system?},
  author = {Sewade Ogun and Vincent Colotte and Emmanuel Vincent},
  journal= {arXiv preprint arXiv:2210.06370},
  year   = {2022}
}

备注

To appear in Proc. SLT 2022, Jan 09-12, 2023, Doha, Qatar