自注意力对基于 Transformer 的自动语音识别的有用性探究
计算与语言
2020-11-11 v1 声音
音频与语音处理
摘要
诸如 Transformers 这样的自注意力模型能够捕捉时间关系而不受事件间距离的限制,已给出具有竞争力的语音识别结果。然而,我们注意到所学上下文的范围从较低自注意力层到较高自注意力层逐渐增加,而声学事件常以从左到右的顺序在短时间跨度内发生。这引出一个问题:对于语音识别,全局视角对 Transformers 中较高的自注意力编码器层是否有用?为研究此问题,我们在 Wall Street Journal 和 Switchboard 上训练具有较低自注意力/较高前馈层编码器的模型。与基线 Transformers 相比,观察到性能未下降反而有微小提升。我们进一步提出了一种注意力矩阵对角性的新度量,并发现所学的对角性确实从较低到较高编码器自注意力层递增。我们得出结论:在训练较高编码器层时全局视角是不必要的。
引用
@article{arxiv.2011.04906,
title = {On the Usefulness of Self-Attention for Automatic Speech Recognition with Transformers},
author = {Shucong Zhang and Erfan Loweimi and Peter Bell and Steve Renals},
journal= {arXiv preprint arXiv:2011.04906},
year = {2020}
}
备注
arXiv admin note: substantial text overlap with arXiv:2005.13895