中文

面向低资源语音识别的文本转语音数据增强

计算与语言 2022-04-04 v1 声音 音频与语音处理

摘要

如今,用于开发自动语音识别(ASR)模型的深度学习技术的主要问题是缺乏转写数据。本研究的目标是提出一种新的数据增强方法,以改进黏着型低资源语言的 ASR 模型。这种新颖的数据增强方法同时生成合成文本与合成音频。我们使用克丘亚语(一种黏着型低资源语言)语料库进行了一些实验。在本研究中,应用序列到序列(seq2seq)模型生成合成文本,并使用克丘亚语的文本转语音(TTS)模型生成合成语音。结果表明,新的数据增强方法能很好地改进克丘亚语的 ASR 模型。在本研究中,通过结合使用合成文本与合成语音,ASR 模型的词错误率(WER)降低了 8.73%。

关键词

引用

@article{arxiv.2204.00291,
  title  = {Text-To-Speech Data Augmentation for Low Resource Speech Recognition},
  author = {Rodolfo Zevallos},
  journal= {arXiv preprint arXiv:2204.00291},
  year   = {2022}
}