中文

基于最大均匀分布准则的幂律非线性用于改进自动语音识别中的神经网络训练

音频与语音处理 2019-12-25 v1 机器学习 声音 机器学习

摘要

在本文中,我们描述了采用幂律非线性的最大分布均匀性(MUD)算法。在该方法中,我们假设若特征分布不过度偏斜,则神经网络训练将更为稳定。我们提出了两类不同的 MUD 方法:基于幂函数的 MUD 与基于直方图的 MUD。在这些方法中,我们首先获取梅尔滤波器组系数,并对每个滤波器组通道施加非线性函数。对于基于幂函数的 MUD,我们采用基于幂函数的非线性,其中幂函数系数在假设非线性输出服从均匀分布的前提下通过最大化似然选取。对于基于直方图的 MUD,则利用训练数据库的经验累积密度函数(CDF)将原始分布变换为均匀分布。在 MUD 处理中,我们不使用关于输入信号能量与人类感知强度之间关系的任何先验知识(例如对数关系)。使用端到端语音识别系统的实验结果表明,基于幂函数的 MUD 优于传统的梅尔滤波器组倒谱系数(MFCC)。在 LibriSpeech 数据库上,我们未使用任何语言模型(LM)即在 test-clean 上取得 4.02% 的词错率(WER),在 test-other 上取得 13.34% 的 WER。本工作的主要贡献在于,我们开发了一种以数据驱动方式设计压缩非线性的新算法,其比以往方法更为灵活,并有望推广至其他领域。

关键词

引用

@article{arxiv.1912.11041,
  title  = {power-law nonlinearity with maximally uniform distribution criterion for improved neural network training in automatic speech recognition},
  author = {Chanwoo Kim and Mehul Kumar and Kwangyoun Kim and Dhananjaya Gowda},
  journal= {arXiv preprint arXiv:1912.11041},
  year   = {2019}
}

备注

Accepted and presented at the ASRU 2019 conference