中文

PADRe:一种用于高效视觉 Transformer 的统一多项式注意力取代方案

计算机视觉与模式识别 2024-07-17 v1

摘要

我们提出了一种称为 Polynomial Attention Drop-in Replacement (PADRe) 的新型、统一的框架,用于取代 transformer 模型中常规的自注意力机制。值得注意的是,最近几种替代注意力机制,包括 Hyena、Mamba、SimA、Conv2Former 和 Castling-ViT,都可视为 PADRe 框架的具体实例。PADRe 利用多项式函数并借鉴近似理论中的既有结果,提高计算效率而不牺牲精度。PADRe 的关键组件包括乘性非线性函数,我们使用简单的、硬件友好的操作如 Hadamard 积实现,仅产生线性计算和内存成本。PADRe 进一步避免使用诸如 Softmax 等复杂函数,却保持与传统自注意力相当或更好的精度。我们评估了 PADRe 作为自注意力的 drop-in 替代方案在各种计算机视觉任务中的有效性。这些任务包括图像分类、图像-based 2D 对象检测和 3D 点云对象检测。实证结果表明,PADRe 在服务器 GPU 和移动 NPU 上比传统自注意力快 11 倍 ~ 43 倍,同时在替换 transformer 模型中的自注意力时保持类似或更好的精度。

关键词

引用

@article{arxiv.2407.11306,
  title  = {PADRe: A Unifying Polynomial Attention Drop-in Replacement for Efficient Vision Transformer},
  author = {Pierre-David Letourneau and Manish Kumar Singh and Hsin-Pai Cheng and Shizhong Han and Yunxiao Shi and Dalton Jones and Matthew Harper Langston and Hong Cai and Fatih Porikli},
  journal= {arXiv preprint arXiv:2407.11306},
  year   = {2024}
}