基于无监督文本到语音合成的数据增强用于改进带口音的语音识别
计算与语言
2024-07-08 v1 声音
音频与语音处理
摘要
本文探讨了将无监督文本到语音合成(TTS)用作数据增强方法,以提高带口音语音识别性能。TTS 系统是用少量带口音语音训练数据及其伪标签训练的,因此是无监督的。这一方法使得无需手动转录即可用于带口音语音数据进行数据增强。生成的合成带口音语音数据随后与可用非口音语音数据组合,用于训练自动语音识别(ASR)系统。对 ASR 实验是在使用大量无监督带口音语音数据预训练的 Wav2vec2.0 模型框架下进行的。用于训练无监督 TTS 的带口音语音数据是读作的语音,选自 L2-ARCTIC 和 British Isles 语料库,而用于评估的自发对话语音则来自 Edinburgh 国际方言英语语料库。实验结果表明,使用由无监督 TTS 生成的合成带口音语音数据对 Wav2vec2.0 模型进行微调,可实现最高达6.1%的相对词错误率降低,与使用来自 Librispeech 语料库的非口音语音数据进行微调的 Wav2vec2.0 基线模型相比。
引用
@article{arxiv.2407.04047,
title = {Improving Accented Speech Recognition using Data Augmentation based on Unsupervised Text-to-Speech Synthesis},
author = {Cong-Thanh Do and Shuhei Imai and Rama Doddipatla and Thomas Hain},
journal= {arXiv preprint arXiv:2407.04047},
year = {2024}
}
备注
Accepted to EUSIPCO 2024