中文

Emilia:一个大规模、广泛、多语言且多样化的语音生成数据集

声音 2025-10-09 v2 计算与语言 音频与语音处理

摘要

语音生成的最新进展得益于大规模训练数据集。然而,现有模型难以捕捉真实人类语音中固有的自发性与多样性,因为它们主要在局限于正式朗读风格的音频书数据集上进行训练。为克服这一局限,我们提出 Emilia-Pipe,一个开源的预处理流程,旨在从宝贵但尚未充分探索的、能够捕捉真实场景下自发人类语音的野外数据源中提取高质量训练数据。利用 Emilia-Pipe,我们构建了 Emilia 数据集,其包含超过 101k 小时、涵盖六种语言(英语、中文、德语、法语、日语和韩语)的语音。此外,我们将 Emilia 扩展为 Emilia-Large,一个超过 216k 小时的数据集,使其成为目前最大的开源语音生成资源之一。大量实验表明,基于 Emilia 训练的模型所生成的语音明显比基于传统音频书数据集训练的模型更加自然、更具类人特性,同时在可懂度上与之相当。这些模型能更好地捕捉多样化的说话人音色以及真实对话风格的完整谱系。我们的工作还凸显了扩大数据集规模对于推进语音生成性能的重要性,并验证了 Emilia 在多语言与跨语言语音生成任务中的有效性。

关键词

引用

@article{arxiv.2501.15907,
  title  = {Emilia: A Large-Scale, Extensive, Multilingual, and Diverse Dataset for Speech Generation},
  author = {Haorui He and Zengqiang Shang and Chaoren Wang and Xuyuan Li and Yicheng Gu and Hua Hua and Liwei Liu and Chen Yang and Jiaqi Li and Peiyang Shi and Yuancheng Wang and Kai Chen and Pengyuan Zhang and Zhizheng Wu},
  journal= {arXiv preprint arXiv:2501.15907},
  year   = {2025}
}

备注

Full version of arXiv:2407.05361, dataset is available at: https://huggingface.co/datasets/amphion/Emilia-Dataset