中文

IndicVoices-R:释放大规模多语言多说话人语音语料库以扩展印度语 TTS

计算与语言 2024-10-08 v2 机器学习 声音 信号处理

摘要

文本到语音 (TTS) 合成的最新进展表明,使用海量网络数据训练的大规模模型能产生高度自然的输出。然而,由于 LibriVox 或 YouTube 等平台上缺乏高质量的人工字幕数据,印度语中的此类数据十分稀缺。为了填补这一空白,我们增强了现有的包含在低质量环境下采集的自然对话的大规模 ASR 数据集,以生成高质量的 TTS 训练数据。我们的流程利用了在英语上训练并应用于印度语的去噪和语音增强模型的跨语言泛化能力。这产生了 IndicVoices-R (IV-R),这是源自 ASR 数据集的最大多语言印度语 TTS 数据集,包含来自 22 种印度语的 10,496 名说话人的 1,704 小时高质量语音。IV-R 匹配了 LJSpeech、LibriTTS 和 IndicTTS 等黄金标准 TTS 数据集的质量。我们还引入了 IV-R 基准,这是首个评估 TTS 模型在印度语语音上的零样本、少样本和多样本说话人泛化能力的基准,确保了年龄、性别和风格的多样性。我们证明,在高质量 IndicTTS 和我们的 IV-R 数据集的联合数据集上微调英语预训练模型,相比于仅在 IndicTTS 数据集上微调,能获得更好的零样本说话人泛化能力。此外,我们的评估揭示了在先前数据集上训练的 TTS 模型对印度语语音的零样本泛化能力有限,我们通过在包含跨越语系的多样化说话人的数据上微调模型来改善这一点。我们开源了所有数据和代码,发布了首个支持所有 22 种印度官方语言的 TTS 模型。

关键词

引用

@article{arxiv.2409.05356,
  title  = {IndicVoices-R: Unlocking a Massive Multilingual Multi-speaker Speech Corpus for Scaling Indian TTS},
  author = {Ashwin Sankar and Srija Anand and Praveen Srinivasa Varadhan and Sherry Thomas and Mehak Singal and Shridhar Kumar and Deovrat Mehendale and Aditi Krishana and Giri Raju and Mitesh Khapra},
  journal= {arXiv preprint arXiv:2409.05356},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024 Datasets and Benchmarks track