中文

稀疏且连续的注意力机制

机器学习 2020-10-30 v3 计算与语言 计算机视觉与模式识别 机器学习

摘要

指数族在机器学习中被广泛使用;它们包含连续和离散域中的许多分布(例如,通过 softmax 变换的高斯、狄利克雷、泊松和类别分布)。这些族中的分布具有固定支撑。相比之下,对于有限域,近期已有关于 softmax 的稀疏替代(例如 sparsemax 和 alpha-entmax)的工作,其具有可变支撑,能够为不相关类别分配零概率。本文将此工作沿两个方向扩展:首先,我们将 alpha-entmax 推广到连续域,揭示了其与 Tsallis 统计和变形指数族的联系。其次,我们引入连续域注意力机制,推导了 alpha 取 {1,2} 时的高效梯度反向传播算法。基于注意力的文本分类、机器翻译和视觉问答实验说明了在 1D 和 2D 中连续注意力的使用,表明其允许关注时间间隔和紧凑区域。

关键词

引用

@article{arxiv.2006.07214,
  title  = {Sparse and Continuous Attention Mechanisms},
  author = {André F. T. Martins and António Farinhas and Marcos Treviso and Vlad Niculae and Pedro M. Q. Aguiar and Mário A. T. Figueiredo},
  journal= {arXiv preprint arXiv:2006.07214},
  year   = {2020}
}

备注

Accepted for spotlight presentation at NeurIPS 2020