中文

用于改进自动语音识别重训练的困难样本挖掘

声音 2019-04-18 v1 机器学习 音频与语音处理

摘要

通过在目标领域中使用越来越多的新训练数据进行重训练,是提升现有自动语音识别(ASR)系统性能的有效方法。近年来,深度神经网络(DNN)已成为 ASR 领域的成功模型。在基于 DNN 方法的训练过程中,利用转录文本与相应标注文本之间的误差反向传播来更新和优化参数。因此,相比于具有较小传播误差的样本,参数更容易受到具有较大传播误差的训练样本的影响。本文将具有显著误差的样本定义为困难样本,并试图通过添加大量此类样本来提升 ASR 系统的性能。遗憾的是,困难样本在目标领域的训练数据中较为稀疏,且人工标注成本高昂。因此,我们提出了一种基于增强深度多示例学习的困难样本挖掘方法,该方法可以利用目标领域中具有人工标注的小数据集子集,从无标注训练数据中发现困难样本。我们将该方法应用于 End2End ASR 任务并获得了最佳性能。

关键词

引用

@article{arxiv.1904.08031,
  title  = {Hard Sample Mining for the Improved Retraining of Automatic Speech Recognition},
  author = {Jiabin Xue and Jiqing Han and Tieran Zheng and Jiaxing Guo and Boyong Wu},
  journal= {arXiv preprint arXiv:1904.08031},
  year   = {2019}
}

备注

Submitted to Interspeech 2019;