中文

一种用于混合声学模型的穿插自注意力与卷积的 Transformer

音频与语音处理 2019-10-24 v1 计算与语言 机器学习

摘要

带有自注意力的 Transformer 在自然语言处理领域取得了巨大成功。近来已有若干关于 Transformer 用于端到端语音识别的研究,但其对于混合声学模型的应用仍十分有限。本文重新审视基于 Transformer 的混合声学模型,并提出一种穿插自注意力与一维卷积的模型结构,其被证明具有更快的收敛速度与更高的识别准确率。我们还研究了 Transformer 模型的若干方面,包括位置编码特征的影响、dropout 正则化,以及带与不带时间限制的训练。在公开 Librispeech 数据集上,我们在交叉熵训练与序列训练阶段均取得了与 Kaldi 基线相比具竞争力的识别结果。为可复现研究,我们在 PyKaldi2 工具箱中发布了我们的源代码与配方。

关键词

引用

@article{arxiv.1910.10352,
  title  = {A Transformer with Interleaved Self-attention and Convolution for Hybrid Acoustic Models},
  author = {Liang Lu},
  journal= {arXiv preprint arXiv:1910.10352},
  year   = {2019}
}

备注

5 pages, submitted to ICASSP 2019