稀疏且连续的注意力机制
机器学习
2020-10-30 v3 计算与语言
计算机视觉与模式识别
机器学习
摘要
指数族在机器学习中被广泛使用;它们包含连续和离散域中的许多分布(例如,通过 softmax 变换的高斯、狄利克雷、泊松和类别分布)。这些族中的分布具有固定支撑。相比之下,对于有限域,近期已有关于 softmax 的稀疏替代(例如 sparsemax 和 alpha-entmax)的工作,其具有可变支撑,能够为不相关类别分配零概率。本文将此工作沿两个方向扩展:首先,我们将 alpha-entmax 推广到连续域,揭示了其与 Tsallis 统计和变形指数族的联系。其次,我们引入连续域注意力机制,推导了 alpha 取 {1,2} 时的高效梯度反向传播算法。基于注意力的文本分类、机器翻译和视觉问答实验说明了在 1D 和 2D 中连续注意力的使用,表明其允许关注时间间隔和紧凑区域。
引用
@article{arxiv.2006.07214,
title = {Sparse and Continuous Attention Mechanisms},
author = {André F. T. Martins and António Farinhas and Marcos Treviso and Vlad Niculae and Pedro M. Q. Aguiar and Mário A. T. Figueiredo},
journal= {arXiv preprint arXiv:2006.07214},
year = {2020}
}
备注
Accepted for spotlight presentation at NeurIPS 2020