中文

利用深度神经网络激活熵应对语音识别中的未知数据

机器学习 2017-09-01 v1 计算与语言 机器学习

摘要

未知数据条件可能对依赖监督机器学习算法的系统造成严重的性能下降。由于数据常常是未知的,且传统机器学习算法以监督方式训练,因此必须使用无监督自适应技术来使模型适应未知数据条件。然而,无监督自适应通常具有挑战性,因为必须基于某个模型生成一些假设,然后利用这些假设引导模型适应未知数据条件。不幸的是,由于训练和测试数据集之间的不匹配,此类假设的可靠性往往很差。在这种情况下,模型假设置信度度量能够为模型自适应执行数据选择。这种方法的基础在于,对于未知数据条件,数据可变性被引入模型,模型将其传播至输出决策,从而影响决策可靠性。在全连接网络中,这种数据可变性以畸变的形式从一层传播到下一层。本工作旨在以网络激活熵的形式估计这种畸变的传播,该熵通过在一个短时运行窗口上测量给定隐藏层每个神经元激活值来计算,然后利用这些测量值计算汇总熵。本工作证明,这种熵度量有助于为无监督模型自适应选择数据,从而在语音识别任务中带来性能提升。标准基准语音识别任务的结果表明,所提出的方法可以通过迭代地使模型适应未知数据的声学条件,来缓解在未知数据条件下所经历的性能下降。

关键词

引用

@article{arxiv.1708.09516,
  title  = {Leveraging Deep Neural Network Activation Entropy to cope with Unseen Data in Speech Recognition},
  author = {Vikramjit Mitra and Horacio Franco},
  journal= {arXiv preprint arXiv:1708.09516},
  year   = {2017}
}

备注

7 pages, Index Terms: automatic speech recognition, robust speech recognition, unsupervised adaptation, neural network activations, confidence measures