Attention 是一种平滑三次样条
人工智能
2024-08-20 v1 机器学习
数值分析
数值分析
摘要
我们强调了一个可能重要但此前未被观察到的洞察:transformer 中的 attention 模块是一个平滑三次样条。从这个角度来看,这个神秘但关键的 transformer 组件成为了经典逼近论中一个旧概念的天然发展。更精确地说,我们证明了使用 ReLU 激活时,attention、masked attention、encoder-decoder attention 都是三次样条。由于 transformer 的每个组件都是由各种 attention 模块(即三次样条)和前馈神经网络(即线性样条)的组合构建而成,其所有组件——编码器、解码器和编码器-解码器模块;多层编码器和解码器;transformer 本身——都是三次或更高阶样条。如果我们假设 Pierce-Birkhoff 猜想,那么反过来也成立,即每个样条都是一个 ReLU 激活的编码器。由于样条通常只是 ,获得平滑的 版本的一种方法是用平滑激活函数替换 ReLU;如果这个激活函数选择为 SoftMax,我们就恢复了 Vaswani 等人提出的原始 transformer。这一洞察通过将 transformer 完全用样条——应用数学中最著名且被充分理解的对象之一——来表述,为 transformer 的本质提供了新的视角。
引用
@article{arxiv.2408.09624,
title = {Attention is a smoothed cubic spline},
author = {Zehua Lai and Lek-Heng Lim and Yucong Liu},
journal= {arXiv preprint arXiv:2408.09624},
year = {2024}
}
备注
20 pages, 2 figures