注意力的基本组成单元
机器学习
2022-02-18 v1 人工智能
机器学习
摘要
注意力在自然与人工智能系统中均发挥着基础性作用。在深度学习中,基于注意力的神经架构(如 transformer 架构)被广泛用于解决自然语言处理及其他领域的问题。本文研究注意力的基本组成单元及其计算性质。在标准深度学习模型内,我们根据注意力的来源、目标与计算机制对所有可能的基本组成单元进行分类。我们识别并研究了三种最重要的机制:加性激活注意力、乘性输出注意力(输出门控)与乘性突触注意力(突触门控)。这些门控机制对应于标准模型的乘性扩展,并被用于当前所有基于注意力的深度学习架构中。我们研究其功能性质,并在线性与多项式阈值门的情况下估计若干注意力组成单元的容量。令人惊讶的是,加性激活注意力在下界证明中起着核心作用。注意力机制降低了某些基本电路的深度,并在不付出二次激活全部代价的情况下利用了其威力。
引用
@article{arxiv.2202.08371,
title = {The Quarks of Attention},
author = {Pierre Baldi and Roman Vershynin},
journal= {arXiv preprint arXiv:2202.08371},
year = {2022}
}