SAMSA: 面向多种数据模态的高效 Transformer
机器学习
2024-08-20 v2
摘要
自注意力机制的多样性使 transformer 在几乎所有数据模态上取得了巨大成功,但受限于二次时间复杂度和训练困难。高效 transformer 则往往依赖于巧妙的数据模态相关构造来克服 transformer 的二次复杂度。这极大地阻碍了它们在不同数据模态上的应用,这是当代基础建模的支柱之一。本文通过提出 SAMSA - SAMpling-Self-Attention,一种在多种数据模态上表现良好的基于上下文感知的线性复杂度自注意力机制,为高效基础建模奠定了基础。我们的机制基于我们发现的一种无替换的可微采样方法。这使自注意力模块能够注意最重要的 token 集合,其中重要性由数据定义。此外,由于推理时不需要可微性,我们稀疏形式的方法耗时开销很小,进一步降低了计算成本。总之,SAMSA 在许多基准测试上实现了具有竞争力甚至 SOTA 的结果,而在推理速度上也优于其他非常专业化的模型。相对于完整自注意力,实际推理时间显著降低,而性能表现从几乎不受影响到甚至超越。我们已在仓库 https://github.com/HySonLab/SAMSA 中发布源代码。
关键词
引用
@article{arxiv.2408.05391,
title = {SAMSA: Efficient Transformer for Many Data Modalities},
author = {Minh Lenhat and Viet Anh Nguyen and Khoa Nguyen and Duong Duc Hieu and Dao Huu Hung and Truong Son Hy},
journal= {arXiv preprint arXiv:2408.05391},
year = {2024}
}