中文

结合数据增强的端到端自动语音识别半监督学习

音频与语音处理 2020-07-29 v1 机器学习 声音

摘要

在本文中,我们应用半监督学习(SSL)与数据增强(DA)以提升端到端ASR的准确率。我们聚焦于一致性正则化原理(该原理已成功应用于图像分类任务),并给出FixMatch与Noisy Student算法的序列到序列(seq2seq)版本。具体而言,我们在用DA扰动输入特征后,以seq2seq模型在线为无标签数据生成伪标签。我们还提出了两种算法的软标签变体以应对伪标签错误,显示出进一步的性能提升。我们在包含1.9kh人工转写训练数据的会话语音数据集上进行SSL实验,仅使用原始标签的25%(475h标签数据)。结果显示,采用软标签与一致性正则化的Noisy Student算法在加入475h无标签数据时实现了10.4%的词错误率(WER)降低,对应92%的恢复率。此外,当迭代加入950h更多无标签数据时,我们使用全部标签训练集(恢复率:78%)的最佳SSL性能仅相差5%以内的WER增加。

关键词

引用

@article{arxiv.2007.13876,
  title  = {Semi-Supervised Learning with Data Augmentation for End-to-End ASR},
  author = {Felix Weninger and Franco Mana and Roberto Gemello and Jesús Andrés-Ferrer and Puming Zhan},
  journal= {arXiv preprint arXiv:2007.13876},
  year   = {2020}
}

备注

To appear in INTERSPEECH 2020