中文

逐元素注意力层:一种优化方案

机器学习 2023-02-14 v1 人工智能 计算机视觉与模式识别

摘要

自基于Transformer的模型流行以来,注意力层的使用已成为趋势,是近年来许多最先进模型的关键要素。然而,实现这些架构——以及深度学习领域的许多其他架构——的最大障碍之一在于其拥有的海量优化参数,这使得其使用受制于强大硬件的可用性。本文提出一种适应点积注意力的新注意力机制方法,该方法利用数组乘法将使用矩阵乘法的点积注意力变为逐元素操作。为检验此方法的有效性,我们使用Fashion MNIST与CIFAR10数据集在分类任务上训练了两个模型(一个具有类VGG架构,另一个采用所提方法)。每个模型在Google Colaboratory的单个Tesla T4 GPU上训练了10个epoch。结果显示,该机制在Fashion MNIST数据集上达到类VGG模型92%的准确率,同时参数量减少97%。对于CIFAR10,其准确率仍相当于类VGG模型的60%,而参数量减少50%。

关键词

引用

@article{arxiv.2302.05488,
  title  = {Element-Wise Attention Layers: an option for optimization},
  author = {Giovanni Araujo Bacochina and Rodrigo Clemente Thom de Souza},
  journal= {arXiv preprint arXiv:2302.05488},
  year   = {2023}
}