基于潜在狄利克雷分配的广播媒体档案组织用于深度神经网络自适应
计算与语言
2016-11-17 v1
摘要
本文提出一种新方法,用于在多样化语音数据中发现潜在域,以用于深度神经网络(DNNs)自适应于自动语音识别。我们的工作聚焦于多类型广播媒体的转写,其通常仅按高级类型(如体育、新闻、纪录片等)宽泛分类。然而,在声学建模方面这些类别是粗糙的。相反,期望潜在域的混合能更好地表示电视节目内的复杂多样行为,从而带来更好且更鲁棒的性能。我们提出一种新方法,利用潜在狄利克雷分配(Latent Dirichlet Allocation)以无监督方式发现这些潜在域。使用唯一二进制码(UBIC)表示LDA域来自适应DNN。在BBC电视广播集上进行的实验(训练超过2000个节目,测试47个节目)表明,与基线混合DNN模型相比,LDA-UBIC DNN将错误率最高相对降低13%。
引用
@article{arxiv.1511.05076,
title = {Latent Dirichlet Allocation Based Organisation of Broadcast Media Archives for Deep Neural Network Adaptation},
author = {Mortaza Doulaty and Oscar Saz and Raymond W. M. Ng and Thomas Hain},
journal= {arXiv preprint arXiv:1511.05076},
year = {2016}
}
备注
IEEE Automatic Speech Recognition and Understanding Workshop (ASRU 2015), 13-17 Dec 2015, Scottsdale, Arizona, USA