中文

通过枢纽语言进行 TTS 数据增强何时有效?

计算与语言 2022-07-21 v1 声音 音频与语音处理

摘要

由于转写音频数据量小,为低资源语言开发自动语音识别(ASR)是一项挑战。对于许多此类语言,音频和文本可分别获得,但带转写的音频则没有。利用文本,可通过文本到语音(TTS)系统合成语音。然而,许多低资源语言也没有高质量的 TTS 系统。我们提出一种替代方案:将目标语言文本经由训练有素的高资源枢纽语言 TTS 系统来生成合成音频。我们研究了该技术在低资源环境下何时及如何最为有效。在我们的实验中,使用数千条合成 TTS 文本-语音对并复制真实数据以平衡可得到最优结果。我们的发现表明,在一组候选枢纽语言中搜索可带来微小提升,且令人惊讶的是,ASR 性能可能受到测得 TTS 质量提升的损害。应用这些发现分别为两种低资源语言 Guaraní 和 Suba 带来了 64.5% 和 45.0% 的字符错误率缩减(CERR)的 ASR 改进。

关键词

引用

@article{arxiv.2207.09889,
  title  = {When Is TTS Augmentation Through a Pivot Language Useful?},
  author = {Nathaniel Robinson and Perez Ogayo and Swetha Gangu and David R. Mortensen and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2207.09889},
  year   = {2022}
}