用于改进端到端语音识别神经网络训练的小能量掩码
音频与语音处理
2020-02-18 v1 机器学习
声音
摘要
本文提出一种小能量掩码(SEM)算法,其对低于某一阈值的值进行掩码处理。具体而言,若某时频单元内的滤波器组能量小于某一能量阈值,则对该单元进行掩码。采用均匀分布随机生成该能量阈值与每条语音峰值滤波器组能量(以分贝计)之比。未掩码的特征元素被缩放,使得该掩码过程中特征值总和保持不变。这一极简算法相较基线端到端语音识别系统,在标准 LibriSpeech test-clean 与 test-other 集上分别取得相对 11.2% 与 13.5% 的词错误率(WER)提升。此外,相较输入丢弃(input dropout)算法,SEM 算法在同一 LibriSpeech test-clean 与 test-other 集上分别相对提升 7.7% 与 11.6%。结合 Transformer LM 的改进浅融合技术,我们在 LibriSpeech test-clean 集上取得 2.62% WER,在 test-other 集上取得 7.87% WER。
引用
@article{arxiv.2002.06312,
title = {Small energy masking for improved neural network training for end-to-end speech recognition},
author = {Chanwoo Kim and Kwangyoun Kim and Sathish Reddy Indurthi},
journal= {arXiv preprint arXiv:2002.06312},
year = {2020}
}
备注
Accepted at ICASSP 2020