中文

隐式核注意力

机器学习 2021-03-02 v3 机器学习

摘要

\textit{注意力}计算表征之间的依赖关系,并鼓励模型聚焦于重要的选择性特征。基于注意力的模型,如 Transformer 和图注意力网络(GAT),被广泛用于序列数据和图结构数据。本文提出了 Transformer 与 GAT 中注意力的新解释与广义结构。对于 Transformer 和 GAT 中的注意力,我们推导出注意力由两部分乘积构成:1)度量两个实例相似度的 RBF 核,以及 2)计算单个实例重要性的 L2L^{2} 范数指数。基于此分解,我们从三方面推广注意力。首先,我们提出具有隐式核函数而非人工核选择的隐式核注意力。其次,我们将 L2L^{2} 范数推广为 LpL^{p} 范数。第三,我们将注意力扩展为结构化多头注意力。我们的广义注意力在分类、翻译和回归任务上展现出更优性能。

关键词

引用

@article{arxiv.2006.06147,
  title  = {Implicit Kernel Attention},
  author = {Kyungwoo Song and Yohan Jung and Dongjun Kim and Il-Chul Moon},
  journal= {arXiv preprint arXiv:2006.06147},
  year   = {2021}
}

备注

AAAI-21