中文

解读 DNN 输出层激活:一种应对语音识别中未见过数据的策略

计算与语言 2018-02-21 v1 声音 音频与语音处理

摘要

未见过的数据会降低深度神经网络声学模型的性能。为应对未见过的数据,需采用自适应技术。对于无标注的未见过数据,必须基于现有模型生成某种假设,并将其用作模型自适应的标签。然而,评估该假设的好坏可能困难,且错误假设会导致训练不佳的模型。在此类情况下,筛选具有可靠假设的数据的策略可确保更好的模型自适应。本工作提出一种用于 DNN 模型自适应的数据选择策略,其中利用 DNN 输出层激活来确定所生成假设的好坏。在 DNN 声学模型中,输出层激活用于生成目标类概率。在未见过数据条件下,最可能目标与次可能目标之间的差异相比见过数据的情况减小,表明模型在生成其假设时可能不确定。本工作提出一种策略,通过使用最可能目标与次可能目标之间的距离度量来分析输出层激活以评估模型性能,并用于无监督自适应的数据选择。

关键词

引用

@article{arxiv.1802.06861,
  title  = {Interpreting DNN output layer activations: A strategy to cope with unseen data in speech recognition},
  author = {Vikramjit Mitra and Horacio Franco},
  journal= {arXiv preprint arXiv:1802.06861},
  year   = {2018}
}

备注

5 pages. arXiv admin note: substantial text overlap with arXiv:1708.09516