中文

低资源环境下的成本效益注意力机制:线性变换的必要性与充分性

机器学习 2025-02-18 v3 人工智能 计算与语言 计算机视觉与模式识别

摘要

从自然语言处理到视觉领域,缩放点积注意力(SDPA)是大多数现代深度学习应用的骨干。不幸的是,其内存和计算需求在低资源环境中可能令人望而却步。在本文中,我们在不牺牲其通用性的前提下提高了其效率。我们提出了三种注意力变体,其中移除了连续的线性变换或添加了一种新颖的变换,并在一系列标准 NLP 和视觉任务上对它们进行了评估。我们提出的模型比标准 SDPA 轻得多(参数少 25-50%)。我们表明,相对于尺寸缩减,这些改变带来的性能成本微不足道,并且在一种情况(Super Attention)下,我们成功地在将速度提高并减少 25% 参数的同时,性能优于 SDPA 高达 10%。

关键词

引用

@article{arxiv.2403.01643,
  title  = {Cost-Effective Attention Mechanisms for Low Resource Settings: Necessity & Sufficiency of Linear Transformations},
  author = {Peyman Hosseini and Mehran Hosseini and Ignacio Castro and Matthew Purver},
  journal= {arXiv preprint arXiv:2403.01643},
  year   = {2025}
}