中文

感知价值的近似注意力机制

机器学习 2021-03-19 v1 计算与语言

摘要

在Transformer中点积注意力取得成功之后,近期提出了大量近似方法以解决其相对于输入长度的二次复杂度问题。然而,迄今为止所有近似方法都忽略了值向量(value vectors)对近似质量的贡献。本文认为,研究工作应致力于近似注意力子层的真实输出,其中包括值向量。我们提出了一种感知价值的目标函数,并从理论和实验上表明,在语言建模背景下,感知价值目标的最优近似显著优于忽略值的最优近似。此外,我们表明,用于计算注意力相似度的核函数选择会大幅影响稀疏近似的质量,其中偏度较小的核函数受值向量的影响更大。

关键词

引用

@article{arxiv.2103.09857,
  title  = {Value-aware Approximate Attention},
  author = {Ankit Gupta and Jonathan Berant},
  journal= {arXiv preprint arXiv:2103.09857},
  year   = {2021}
}