隐式核注意力
机器学习
2021-03-02 v3 机器学习
摘要
\textit{注意力}计算表征之间的依赖关系,并鼓励模型聚焦于重要的选择性特征。基于注意力的模型,如 Transformer 和图注意力网络(GAT),被广泛用于序列数据和图结构数据。本文提出了 Transformer 与 GAT 中注意力的新解释与广义结构。对于 Transformer 和 GAT 中的注意力,我们推导出注意力由两部分乘积构成:1)度量两个实例相似度的 RBF 核,以及 2)计算单个实例重要性的 范数指数。基于此分解,我们从三方面推广注意力。首先,我们提出具有隐式核函数而非人工核选择的隐式核注意力。其次,我们将 范数推广为 范数。第三,我们将注意力扩展为结构化多头注意力。我们的广义注意力在分类、翻译和回归任务上展现出更优性能。
引用
@article{arxiv.2006.06147,
title = {Implicit Kernel Attention},
author = {Kyungwoo Song and Yohan Jung and Dongjun Kim and Il-Chul Moon},
journal= {arXiv preprint arXiv:2006.06147},
year = {2021}
}
备注
AAAI-21