中文

SCCA:用于长上下文语义扩展的移位跨块注意力

计算与语言 2023-12-13 v1 人工智能

摘要

稀疏注意力作为一种高效方法,可以显著降低计算成本,但当前的稀疏注意力往往依赖于窗口自注意力,这阻碍了全局信息流。针对此问题,我们提出了移位跨块注意力(Shifted Cross Chunk Attention, SCCA),利用不同的 KV 移位策略在每个注意力层中扩展感受野。此外,我们结合膨胀注意力(Dilated Attention, DA)和膨胀邻域注意力(Dilated Neighborhood Attention, DNA)提出了移位膨胀注意力(Shifted Dilated Attention, SDA)。SCCA 和 SDA 均可在多头注意力中累积注意力结果,以获得近似全注意力的感受野。在本文中,我们使用不同模式的 SCCA 以及 SCCA 与 SDA 的组合进行了语言建模实验。与当前的稀疏注意力相比,所提出的移位跨块注意力(SCCA)结合位置插值(Positional Interpolation, PI)和 LoRA,能够有效地将大型语言模型(LLMs)扩展至更长的上下文。值得注意的是,SCCA 在单个 V100 上将 LLaMA2 7B 的上下文从 4k 扩展至 8k。这种注意力模式可提供一种即插即用的微调方法,在保留模型原始架构的同时扩展模型上下文,并且与大多数现有技术兼容。

关键词

引用

@article{arxiv.2312.07305,
  title  = {SCCA: Shifted Cross Chunk Attention for long contextual semantic expansion},
  author = {Yuxiang Guo},
  journal= {arXiv preprint arXiv:2312.07305},
  year   = {2023}
}

备注

work in progress