面向更长序列的双向交叉注意力 Transformer
计算机视觉与模式识别
2024-11-01 v3
摘要
我们提出了一种新的双向 Transformer 架构(BiXT),其计算成本和内存消耗随输入规模线性增长,但不受其他高效 Transformer 方法在性能下降或仅限于单一输入模态的限制。BiXT 受 Perceiver 架构启发,但将迭代注意力替换为高效的双向交叉注意力模块,其中输入标记和潜在变量相互注意力,利用两种之间的自然注意力对称性。这种方法解决了 Perceiver 类架构经历的关键瓶颈,使其能够在多个层面上同步处理语义('what')和位置('where'),从而可直接应用于密集型和实例化任务。通过将效率与完整 Transformer 架构的通用性和性能相结合,BiXT 能够处理更长的序列,如点云、文本或图像,采用更高的特征分辨率,并在点云分段、语义图像分段、图像分类、层次序列建模和文档检索等多项任务上取得竞争成绩。我们的实验表明,BiXT 模型在分类和分割等视觉任务上超越更大规模的竞争模型,利用更长的序列更高效;在序列建模和文档检索方面,性能与完整 Transformer 变体相当,但仅需 28% 的 FLOPs,速度提升最高可达 8.4 倍。
引用
@article{arxiv.2402.12138,
title = {Perceiving Longer Sequences With Bi-Directional Cross-Attention Transformers},
author = {Markus Hiller and Krista A. Ehinger and Tom Drummond},
journal= {arXiv preprint arXiv:2402.12138},
year = {2024}
}
备注
Accepted at NeurIPS 2024; Code and models will be available at https://github.com/mrkshllr/BiXT