面向低资源语音识别的文本转语音数据增强
计算与语言
2022-04-04 v1 声音
音频与语音处理
摘要
如今,用于开发自动语音识别(ASR)模型的深度学习技术的主要问题是缺乏转写数据。本研究的目标是提出一种新的数据增强方法,以改进黏着型低资源语言的 ASR 模型。这种新颖的数据增强方法同时生成合成文本与合成音频。我们使用克丘亚语(一种黏着型低资源语言)语料库进行了一些实验。在本研究中,应用序列到序列(seq2seq)模型生成合成文本,并使用克丘亚语的文本转语音(TTS)模型生成合成语音。结果表明,新的数据增强方法能很好地改进克丘亚语的 ASR 模型。在本研究中,通过结合使用合成文本与合成语音,ASR 模型的词错误率(WER)降低了 8.73%。
引用
@article{arxiv.2204.00291,
title = {Text-To-Speech Data Augmentation for Low Resource Speech Recognition},
author = {Rodolfo Zevallos},
journal= {arXiv preprint arXiv:2204.00291},
year = {2022}
}