中文

CAB:面向长序列建模的细粒度注意力综合基准

机器学习 2025-01-14 v4

摘要

Transformer 在语言、图像和语音处理中取得了显著成功。近年来,人们提出了各种高效注意力架构,以在大幅保留 Transformer 效能的同时提升其效率,尤其是在长序列建模方面。用于测试这些高效方法在长程建模能力的广泛使用的基准是 Long Range Arena (LRA)。然而,LRA 仅关注标准双向(或非因果)自注意力,而完全忽略了交叉注意力和单向(或因果)注意力,它们对下游应用同样重要。在本文中,我们提出了综合注意力基准(Comprehensive Attention Benchmark,CAB),其基于一种细粒度注意力分类法,包含四种可区分的注意力模式,即非因果自注意力、因果自注意力、非因果交叉注意力和因果交叉注意力。CAB 从不同的研究领域收集了七项真实世界任务,以在四种注意力模式下评估高效注意力。在这些任务中,CAB 在八种骨干网络中验证了高效注意力,以展示其在神经网络架构间的泛化能力。我们进行了详尽的实验,对九种采用不同设计理念的主流高效注意力架构在 CAB 上的表现进行了基准测试。广泛的实验结果也揭示了高效注意力的基本问题,例如相对于原始注意力的效率长度、跨注意力模式的性能一致性、注意力机制的收益,以及长上下文语言建模中的插值/外推。

关键词

引用

@article{arxiv.2210.07661,
  title  = {CAB: Comprehensive Attention Benchmarking on Long Sequence Modeling},
  author = {Jun Zhang and Shuyang Jiang and Jiangtao Feng and Lin Zheng and Lingpeng Kong},
  journal= {arXiv preprint arXiv:2210.07661},
  year   = {2025}
}