利用并行计划采样与相对位置嵌入提升 Transformer 在语音识别中的泛化能力
计算与语言
2020-12-01 v2 音频与语音处理
摘要
Transformer 近来在许多序列到序列转换任务中展现出前景良好的结果。它利用若干前馈自注意力层取代基于注意力的编码器解码器(AED)架构中的循环神经网络(RNN)。自注意力层通过为并行计算而引入序列中词元的正弦位置嵌入来学习时间依赖。相较于 RNN 的串行操作,可获得更快的训练迭代速度。Transformer 更深的层也使其表现优于基于 RNN 的 AED。然而,在应用计划采样训练时,这种并行能力丧失。带有正弦位置嵌入的自注意力也可能对在不同位置具有相似声学或语义信息的较长序列造成性能下降。为解决这些问题,我们提出使用并行计划采样(PSS)与相对位置嵌入(RPE)来帮助 Transformer 泛化到未见过的数据。我们提出的方法在 10,000 小时 Mandarin ASR 任务上对于短语句实现了 7% 的相对提升,对于长语句实现了 70% 的相对增益。
引用
@article{arxiv.1911.00203,
title = {Improving Generalization of Transformer for Speech Recognition with Parallel Schedule Sampling and Relative Positional Embedding},
author = {Pan Zhou and Ruchao Fan and Wei Chen and Jia Jia},
journal= {arXiv preprint arXiv:1911.00203},
year = {2020}
}