中文

10小时数据足矣

声音 2022-10-25 v1 音频与语音处理

摘要

我们提出一种生成伪普通话语音数据的新流程,称为CAMP(字符音频混合),旨在从字符尺度生成音频。我们还提出一种构建适配CAMP的普通话字符尺度音频数据库的方法,称为META-AUDIO,其充分利用音频数据并能极大增加数据库的数据多样性。实验表明我们的CAMP方法简单且十分有效。例如,我们使用AISHELL-1中的10小时音频数据及由CAMP生成的伪音频数据训练模型,取得了具竞争力的11.07字符错误率(CER)。此外,我们还仅使用AIDATATANG数据集中的10小时音频数据及CAMP生成的伪音频数据进行训练,同样取得了具竞争力的8.26 CER。

关键词

引用

@article{arxiv.2210.13067,
  title  = {10 hours data is all you need},
  author = {Zeping Min and Qian Ge and Zhong Li},
  journal= {arXiv preprint arXiv:2210.13067},
  year   = {2022}
}