AIPNet:用于端到端语音识别的口音不变网络生成对抗预训练
计算与语言
2019-11-28 v1 声音
音频与语音处理
摘要
作为语音多变性的主要来源之一,口音对语音识别系统的鲁棒性构成了巨大挑战。本文的目标是构建一个在口音间具有良好泛化能力的统一端到端语音识别系统。为此,我们提出了一种基于生成对抗网络(GAN)的口音不变表示学习新型预训练框架 AIPNet:口音不变预训练网络(Accent Invariant Pre-training Networks)。我们预训练 AIPNet,通过对未必有转录文本的口音数据进行对抗训练,从声学特征中解耦口音不变与口音相关特性。我们进一步将口音不变模块与基于注意力的编码器-解码器模型连接,对 AIPNet 进行微调以用于多口音语音识别。实验中,我们的方法与包括口音相关和口音无关模型在内的四个基线进行比较。在 9 种英语口音上的实验结果表明,当所有口音均有转录文本时,所提方法相对平均词错率(WER)比所有基线低 2.3 \sim 4.5%,当仅美式口音有转录文本时低 1.6 \sim 6.1%。
引用
@article{arxiv.1911.11935,
title = {AIPNet: Generative Adversarial Pre-training of Accent-invariant Networks for End-to-end Speech Recognition},
author = {Yi-Chen Chen and Zhaojun Yang and Ching-Feng Yeh and Mahaveer Jain and Michael L. Seltzer},
journal= {arXiv preprint arXiv:1911.11935},
year = {2019}
}