SCCA:用于长上下文语义扩展的移位跨块注意力
计算与语言
2023-12-13 v1 人工智能
摘要
稀疏注意力作为一种高效方法,可以显著降低计算成本,但当前的稀疏注意力往往依赖于窗口自注意力,这阻碍了全局信息流。针对此问题,我们提出了移位跨块注意力(Shifted Cross Chunk Attention, SCCA),利用不同的 KV 移位策略在每个注意力层中扩展感受野。此外,我们结合膨胀注意力(Dilated Attention, DA)和膨胀邻域注意力(Dilated Neighborhood Attention, DNA)提出了移位膨胀注意力(Shifted Dilated Attention, SDA)。SCCA 和 SDA 均可在多头注意力中累积注意力结果,以获得近似全注意力的感受野。在本文中,我们使用不同模式的 SCCA 以及 SCCA 与 SDA 的组合进行了语言建模实验。与当前的稀疏注意力相比,所提出的移位跨块注意力(SCCA)结合位置插值(Positional Interpolation, PI)和 LoRA,能够有效地将大型语言模型(LLMs)扩展至更长的上下文。值得注意的是,SCCA 在单个 V100 上将 LLaMA2 7B 的上下文从 4k 扩展至 8k。这种注意力模式可提供一种即插即用的微调方法,在保留模型原始架构的同时扩展模型上下文,并且与大多数现有技术兼容。
引用
@article{arxiv.2312.07305,
title = {SCCA: Shifted Cross Chunk Attention for long contextual semantic expansion},
author = {Yuxiang Guo},
journal= {arXiv preprint arXiv:2312.07305},
year = {2023}
}
备注
work in progress