中文

用于改进端到端语音识别神经网络训练的小能量掩码

音频与语音处理 2020-02-18 v1 机器学习 声音

摘要

本文提出一种小能量掩码(SEM)算法,其对低于某一阈值的值进行掩码处理。具体而言,若某时频单元内的滤波器组能量小于某一能量阈值,则对该单元进行掩码。采用均匀分布随机生成该能量阈值与每条语音峰值滤波器组能量(以分贝计)之比。未掩码的特征元素被缩放,使得该掩码过程中特征值总和保持不变。这一极简算法相较基线端到端语音识别系统,在标准 LibriSpeech test-clean 与 test-other 集上分别取得相对 11.2% 与 13.5% 的词错误率(WER)提升。此外,相较输入丢弃(input dropout)算法,SEM 算法在同一 LibriSpeech test-clean 与 test-other 集上分别相对提升 7.7% 与 11.6%。结合 Transformer LM 的改进浅融合技术,我们在 LibriSpeech test-clean 集上取得 2.62% WER,在 test-other 集上取得 7.87% WER。

关键词

引用

@article{arxiv.2002.06312,
  title  = {Small energy masking for improved neural network training for end-to-end speech recognition},
  author = {Chanwoo Kim and Kwangyoun Kim and Sathish Reddy Indurthi},
  journal= {arXiv preprint arXiv:2002.06312},
  year   = {2020}
}

备注

Accepted at ICASSP 2020