一种用于混合声学模型的穿插自注意力与卷积的 Transformer
音频与语音处理
2019-10-24 v1 计算与语言
机器学习
摘要
带有自注意力的 Transformer 在自然语言处理领域取得了巨大成功。近来已有若干关于 Transformer 用于端到端语音识别的研究,但其对于混合声学模型的应用仍十分有限。本文重新审视基于 Transformer 的混合声学模型,并提出一种穿插自注意力与一维卷积的模型结构,其被证明具有更快的收敛速度与更高的识别准确率。我们还研究了 Transformer 模型的若干方面,包括位置编码特征的影响、dropout 正则化,以及带与不带时间限制的训练。在公开 Librispeech 数据集上,我们在交叉熵训练与序列训练阶段均取得了与 Kaldi 基线相比具竞争力的识别结果。为可复现研究,我们在 PyKaldi2 工具箱中发布了我们的源代码与配方。
引用
@article{arxiv.1910.10352,
title = {A Transformer with Interleaved Self-attention and Convolution for Hybrid Acoustic Models},
author = {Liang Lu},
journal= {arXiv preprint arXiv:1910.10352},
year = {2019}
}
备注
5 pages, submitted to ICASSP 2019