从块Toeplitz矩阵到图上的微分方程:面向可扩展掩码Transformer的一般理论
机器学习
2023-03-29 v8 人工智能
摘要
本文中,据我们所知,我们提供了首个将各种掩码机制以可扩展方式纳入Transformer架构的综合方法。我们表明,近期关于线性因果注意力(Choromanski等人,2021)和对数线性RPE注意力(Luo等人,2021)的结果都是这一一般机制的特例。然而,通过将问题转化为对未掩码注意力的拓扑(基于图)调制,我们获得了若干此前未知的结果,包括高效的d维RPE掩码和图核掩码。我们利用了多种数学技术,从谱分析、动态规划、随机游走到图上求解马尔可夫过程的新算法。我们提供了相应的实证评估。
引用
@article{arxiv.2107.07999,
title = {From block-Toeplitz matrices to differential equations on graphs: towards a general theory for scalable masked Transformers},
author = {Krzysztof Choromanski and Han Lin and Haoxian Chen and Tianyi Zhang and Arijit Sehanobish and Valerii Likhosherstov and Jack Parker-Holder and Tamas Sarlos and Adrian Weller and Thomas Weingarten},
journal= {arXiv preprint arXiv:2107.07999},
year = {2023}
}
备注
20 pages, 12 figures