中文

无概率笼约束的归一化注意力

机器学习 2020-05-20 v1 机器学习

摘要

注意力架构被广泛使用;随着 Transformer 取得一系列最先进结果,它们最近重新流行。然而,softmax 注意力的几何含义在很大程度上仍未被探索。在这项工作中,我们强调了将注意力权重约束到概率单纯形及由此产生的值向量凸包的限制。我们表明 Transformer 在初始化时依赖于序列长度并偏向于词元孤立,并将 Transformer 与简单的极大池化与求和池化——两个很少被报道的强基线——进行对比。我们提议用归一化替代自注意力中的 softmax,从而产生一种对超参数与数据偏置鲁棒、普遍适用的架构。我们以超过 25,000 个训练模型的实证结果支持我们的见解。所有结果与实现均已公开。

关键词

引用

@article{arxiv.2005.09561,
  title  = {Normalized Attention Without Probability Cage},
  author = {Oliver Richter and Roger Wattenhofer},
  journal= {arXiv preprint arXiv:2005.09561},
  year   = {2020}
}

备注

Preprint, work in progress. Feedback welcome