中文

基于注意力 CNN-BLSTM 的语句级端到端语言识别

音频与语音处理 2019-02-21 v1 机器学习 声音

摘要

在本文中,我们提出一种端到端语言识别框架,即基于注意力的卷积神经网络-双向长短期记忆网络(CNN-BLSTM)。该模型在语句级别上执行,这意味着语句级决策可直接从神经网络的输出获得。为处理具有完全任意且可能较长时长的语音语句,我们将 CNN-BLSTM 模型与自注意力池化层结合。前端 CNN-BLSTM 模块充当变长输入的局部模式提取器,其上的自注意力池化层用于获取固定维度的语句级表征。我们在 NIST LRE07 闭集任务上进行了实验,结果表明所提出的基于注意力的 CNN-BLSTM 模型在所有 3 秒、10 秒、30 秒时长任务上与其他最先进的语句级神经网络方法取得了相当的错误率降低。

关键词

引用

@article{arxiv.1902.07374,
  title  = {Utterance-level end-to-end language identification using attention-based CNN-BLSTM},
  author = {Weicheng Cai and Danwei Cai and Shen Huang and Ming Li},
  journal= {arXiv preprint arXiv:1902.07374},
  year   = {2019}
}

备注

Accepted for ICASSP 2019