语音识别中集外词的检索学习
计算与语言
2016-03-02 v4
摘要
许多专有名称(PNs)是用于处理历时音频数据的语音识别系统的集外词(OOV)。为帮助恢复系统漏掉的PNs,可利用语音内容的语义上下文从众多OOVs中检索相关的OOV PNs。本文提出两个神经网络模型用于检索与音频文档相关的OOV PNs:(a) 文档级连续词袋(D-CBOW), (b) 文档级连续加权词袋(D-CBOW2)。这两个模型均以文档词作为输入,并以最大化共现OOV PNs的检索为目标进行学习。通过D-CBOW2模型,我们提出一种新方法,其中输入嵌入层增强了一个上下文锚层。该层学习为输入词分配重要性,并能在词袋神经网络模型中捕获(任务特定的)关键词。在法国广播新闻视频上的实验表明,这两个模型优于基于LDA、Skip-gram和Paragraph Vectors原始嵌入的基线方法。结合D-CBOW和D-CBOW2模型在训练时收敛更快。
引用
@article{arxiv.1511.05389,
title = {Learning to retrieve out-of-vocabulary words in speech recognition},
author = {Imran Sheikh and Irina Illina and Dominique Fohr and Georges Linarès},
journal= {arXiv preprint arXiv:1511.05389},
year = {2016}
}
备注
Updated references, added appendix discussing more results; added more discussion, replaced simple phone search results with KWS results; added KWS results for both training phase, probably last update