中文

用于改进声学到词语音识别的声学接地词嵌入

计算与语言 2019-04-01 v1

摘要

用于端到端自动语音识别的直接声学到词(A2W)系统比子词系统更易于训练,且解码更高效。然而,A2W 系统在训练时数据有限的情况下,以及在解码时识别训练词汇表外词语时会遇到困难。为解决这些不足,我们研究了在 A2W 系统中使用近期提出的声学及声学接地词嵌入技术。其思想是将 AWE 识别器最终的预 softmax 权重矩阵视为词嵌入向量矩阵,并利用外部训练的词嵌入集合来提升该矩阵的质量。我们具体引入两点:(1) 在训练时强制外部嵌入与识别器权重之间的相似性;(2) 在测试时使用词嵌入预测词汇表外词。我们的词嵌入模型是声学接地的,即其与声学嵌入联合学习以编码词语的声学-语音内容;并且它是参数化的,从而可嵌入任意(可能为词汇表外)字符序列。我们发现这两种技术均提升了 A2W 识别器在会话电话语音上的性能。

关键词

引用

@article{arxiv.1903.12306,
  title  = {Acoustically Grounded Word Embeddings for Improved Acoustics-to-Word Speech Recognition},
  author = {Shane Settle and Kartik Audhkhasi and Karen Livescu and Michael Picheny},
  journal= {arXiv preprint arXiv:1903.12306},
  year   = {2019}
}

备注

To appear at ICASSP 2019