Paramixer:在稀疏因子中参数化混合链接优于点积自注意力
机器学习
2022-04-25 v1 人工智能
摘要
自注意力是神经建模中广泛使用的构建模块,用于混合长距离数据元素。大多数自注意力网络采用成对点积指定注意力系数。然而,这些方法对序列长度 需要 计算代价。尽管已引入一些近似方法缓解二次代价,点积方法的性能仍受限于注意力矩阵分解中的低秩约束。本文提出一种新颖可扩展且高效的混合构建块 Paramixer。我们的方法将交互矩阵分解为若干稀疏矩阵,并用以数据元素为输入的 MLP 参数化非零项。新构建块总体计算代价低至 。此外,Paramixer 中所有分解矩阵均为满秩,故不受低秩瓶颈影响。我们在合成与多种真实世界长序列数据集上测试新方法,并与若干 SOTA 注意力网络比较。实验结果表明 Paramixer 在大多数学习任务中性能更优。
引用
@article{arxiv.2204.10670,
title = {Paramixer: Parameterizing Mixing Links in Sparse Factors Works Better than Dot-Product Self-Attention},
author = {Tong Yu and Ruslan Khalitov and Lei Cheng and Zhirong Yang},
journal= {arXiv preprint arXiv:2204.10670},
year = {2022}
}
备注
10 pages, 5 figures, accepted by CVPR2022