为Transformer中的线性相对位置编码学习傅里叶变换
机器学习
2024-04-05 v2
摘要
我们提出了一类新的线性Transformer,称为FourierLearner-Transformers(FLTs),它融合了广泛的相对位置编码(RPE)机制。这些包括应用于序列数据的常规RPE技术,以及作用于嵌入高维欧几里得空间的几何数据的新型RPE。FLT通过隐式学习其谱表示来构建最优RPE机制。与其他将高效低秩线性注意力与RPE结合的架构相比,FLT在内存使用方面保持实用,且不需要对RPE掩码结构做额外假设。此外,FLT允许应用某些结构归纳偏置技术来指定掩码策略,例如,它们提供了一种学习本文引入的所谓局部RPE的方法,并在语言建模中相比其他几种线性Transformer获得了精度提升。我们还在其他数据模态和任务上对FLT进行了彻底测试,如图像分类、3D分子建模和可学习优化器。据我们所知,对于3D分子数据,FLT是首个提供线性注意力并融合RPE掩码的Transformer架构。
引用
@article{arxiv.2302.01925,
title = {Learning a Fourier Transform for Linear Relative Positional Encodings in Transformers},
author = {Krzysztof Marcin Choromanski and Shanda Li and Valerii Likhosherstov and Kumar Avinava Dubey and Shengjie Luo and Di He and Yiming Yang and Tamas Sarlos and Thomas Weingarten and Adrian Weller},
journal= {arXiv preprint arXiv:2302.01925},
year = {2024}
}
备注
AISTATS 2024