中文

随机注意力头移除:一种简单有效的改进基于 Transformer 的 ASR 模型的方法

计算与语言 2021-04-07 v2 声音 音频与语音处理

摘要

近来,基于 Transformer 的模型展现出具有竞争力的自动语音识别(ASR)性能。这些模型成功的一个关键因素是多头注意力机制。然而,对于训练好的模型,我们此前观察到许多注意力矩阵接近对角,表明相应注意力头存在冗余。我们也发现某些减少了注意力头数量的架构具有更好性能。由于搜寻最佳结构耗时 prohibitive,我们提出在训练期间随机移除注意力头并在测试时保留所有注意力头,从而最终模型是不同架构模型的集成。所提方法还迫使每个头独立学习最有用的模式。我们将该方法应用于训练基于 Transformer 与卷积增强 Transformer(Conformer)的 ASR 模型。我们的方法在 Wall Street Journal、AISHELL、Switchboard 与 AMI 数据集上相较强基线取得一致性能提升。据我们所知,我们在 Switchboard 与 AMI 上取得了基于 Transformer 的端到端模型的最优性能。

关键词

引用

@article{arxiv.2011.04004,
  title  = {Stochastic Attention Head Removal: A simple and effective method for improving Transformer Based ASR Models},
  author = {Shucong Zhang and Erfan Loweimi and Peter Bell and Steve Renals},
  journal= {arXiv preprint arXiv:2011.04004},
  year   = {2021}
}