中文

DNN-HMM声学建模的信息论分析

声音 2017-11-09 v2 计算与语言 机器学习

摘要

我们提出一种信息论框架,用于定量评估基于隐马尔可夫模型(HMM)的自动语音识别(ASR)的声学建模。声学建模为短时空窗的语音声学特征产生HMM子词状态的概率。我们将ASR视为一个通信信道,其中输入的子词概率传递关于输出HMM状态序列的信息。因此,声学模型的质量通过该信道传输的信息量来量化。从子词概率推断最可能HMM状态序列的过程称为解码。基于HMM的解码假设声学模型产生准确的状态级概率,且给定底层隐藏状态的数据分布独立于序列中任何其他状态。我们根据若干互信息量量化1)声学模型准确性以及2)其对数据与HMM条件独立假设之间失配的鲁棒性。在此背景下,利用深度神经网络(DNN)后验概率可得到一个简单直接的分析框架,以评估基于HMM解码的声学模型的缺陷。该分析使我们能够在无需任何显式语音识别的情况下评估高斯混合声学模型(GMM)以及DNN中许多隐藏层的重要性。此外,它阐明了低维模型对增强声学建模以更好符合基于HMM解码要求的贡献。

关键词

引用

@article{arxiv.1709.01144,
  title  = {Information Theoretic Analysis of DNN-HMM Acoustic Modeling},
  author = {Pranay Dighe and Afsaneh Asaei and Hervé Bourlard},
  journal= {arXiv preprint arXiv:1709.01144},
  year   = {2017}
}

备注

Theoretical flaw, needs major revision