中文

具有词嵌入正则化与融合解码的序列到序列自动语音识别

计算与语言 2020-02-06 v2 声音 音频与语音处理

摘要

在本文中,我们研究了现成词嵌入能为序列到序列(seq-to-seq)自动语音识别(ASR)带来的益处。我们首先通过最大化变换后的解码器特征与目标词嵌入之间的余弦相似度,引入了词嵌入正则化。基于该正则化解码器,我们进一步提出了融合解码机制。该机制使解码器能够通过吸收由变换解码器特征所携带的信息来考虑解码过程中的语义一致性,而该特征被学习为接近目标词嵌入。在 LibriSpeech 上的初步结果表明,预训练词嵌入能以可忽略的代价显著降低 ASR 识别错误率,并且在 Skip-gram、CBOW 和 BERT 中词嵌入算法的选择十分重要。

关键词

引用

@article{arxiv.1910.12740,
  title  = {Sequence-to-sequence Automatic Speech Recognition with Word Embedding Regularization and Fused Decoding},
  author = {Alexander H. Liu and Tzu-Wei Sung and Shun-Po Chuang and Hung-yi Lee and Lin-shan Lee},
  journal= {arXiv preprint arXiv:1910.12740},
  year   = {2020}
}

备注

ICASSP 2020