中文

无监督声学模型自适应的可微分池化

计算与语言 2016-07-14 v2 机器学习

摘要

我们提出了一种包含参数化可微分池化算子的深度神经网络(DNN)声学模型。无监督声学模型自适应被表述为更新每个池化算子所实现的决策边界的问题。具体地,我们实验了两类池化参数化:学到的 LpL_p-范数池化与加权高斯池化,其中两种算子的权重均视为说话人相关的。我们使用三个不同的大词汇量语音识别语料库进行了研究:AMI meetings、TED talks 和 Switchboard 对话电话语音。我们证明可微分池化算子提供了一种鲁棒且相对低维的声学模型自适应方式,相较于未自适应系统相对词错误率降低幅度为5--20%,而未自适应系统本身优于基于全连接DNN的基线声学模型。我们还研究了所提技术在不同自适应条件下的表现,包括自适应数据的质量、与其他特征和模型空间自适应方法的互补性,并对各提出方法的特点进行了分析。

关键词

引用

@article{arxiv.1603.09630,
  title  = {Differentiable Pooling for Unsupervised Acoustic Model Adaptation},
  author = {Pawel Swietojanski and Steve Renals},
  journal= {arXiv preprint arXiv:1603.09630},
  year   = {2016}
}

备注

11 pages, 7 Tables, 7 Figures in IEEE/ACM Transactions on Audio, Speech, and Language Processing, vol. 24, num. 11, 2016