中文

两全其美:基于对抗迁移学习的鲁棒口音语音识别

音频与语音处理 2021-03-11 v1

摘要

训练用于自动语音识别(ASR)的深度神经网络需要大量转写语音。这对于训练针对口音语音的鲁棒模型成为瓶颈,因为口音语音通常在发音及其他语义上呈现高变异性,而获取大量标注口音数据既繁琐又昂贵。通常我们仅能获取来自不同口音的大量未标注语音。本工作中,我们利用这些未标注数据,为仅以一种口音训练过的 ASR 模型提供语义正则化,以提升其在多种口音上的性能。我们提出口音预训练(Acc-PT),一种结合迁移学习和对抗训练的半监督训练策略。我们的方法在多种口音上将最先进 ASR 模型的平均性能较基线提升 33%,仅使用一种标准口音的标注样本,以及少至 105 分钟目标口音的未标注语音进行训练。

关键词

引用

@article{arxiv.2103.05834,
  title  = {Best of Both Worlds: Robust Accented Speech Recognition with Adversarial Transfer Learning},
  author = {Nilaksh Das and Sravan Bodapati and Monica Sunkara and Sundararajan Srinivasan and Duen Horng Chau},
  journal= {arXiv preprint arXiv:2103.05834},
  year   = {2021}
}