用于 ASR 的带卷积上下文的 Transformer 网络
计算与语言
2020-03-04 v2
摘要
Transformer 网络近期在神经机器翻译及其他 NLP 任务上的成功,引发了大量将其应用于语音识别的研究工作。近期的研究探讨了将位置嵌入与语音特征相结合的方式,以及 Transformer 网络大规模学习中优化的稳定性等关键问题。在本文中,我们提出用卷积学习的输入表示来替代 Transformer 的正弦位置嵌入。这些上下文表示为后续的 Transformer 块提供了发现局部概念间长程关系所需的相对位置信息。所提出的系统具有良好的优化特性,我们报告的结果是在固定学习率 1.0 且无需预热步数的情况下取得的。当不提供额外 LM 文本时,所提模型在 Librispeech 的 “test clean” 与 “test other” 子集上取得了具竞争力的 4.7% 与 12.9% 的 WER。
引用
@article{arxiv.1904.11660,
title = {Transformers with convolutional context for ASR},
author = {Abdelrahman Mohamed and Dmytro Okhonko and Luke Zettlemoyer},
journal= {arXiv preprint arXiv:1904.11660},
year = {2020}
}