中文

SinkLoRA:面向长上下文大语言模型的提升效率与对话能力

计算与语言 2024-06-11 v1

摘要

将 Transformer 模型的功能扩展到更长的序列长度已成为关键挑战。这一扩展不仅对于改进语言翻译和长上下文处理等任务至关重要,也对于实现诸如聊天机器人、代码生成和多媒体内容创建等新应用至关重要。主要障碍是自注意力机制,其计算时间和内存需求随序列长度呈二次增长。LongLoRA 提出了移位稀疏注意 (S^2-Attn),有效地实现了上下文扩展,并在类似微调带有普通注意力的性能方面实现了非平凡的计算节省。然而,LongLoRA 仍不如普通注意力高效,仅达到对全注意力的 39% 意义提升。这一不效率源于注意力头模式中所施加的循环位移,导致注意力头结构混乱或令不同 token 组之间进行不必要的信息交换。为解决这些问题,我们提出了 SinkLoRA,具有更好的工作划分。具体地,(1) 我们开发了带有分段和重组算法的 SF-Attn,以按比例返回循环位移的注意力头组到其未位移状态,同时包含 "sink attention tokens" 的全局注意力,从而在微调后实现对全注意力意义提升的 92%;(2) 我们应用了已知的最佳 KV 缓存压缩算法 H_2O 以加速推理。此外,我们使用我们自收集的 LongAlpaca-plus 数据集对 SinkLoRA 进行了监督式微调。我们的所有代码、模型、数据集和演示均可在 https://github.com/Dexter-GT-86/SinkLoRA 上获取。

关键词

引用

@article{arxiv.2406.05678,
  title  = {SinkLoRA: Enhanced Efficiency and Chat Capabilities for Long-Context Large Language Models},
  author = {Hengyu Zhang},
  journal= {arXiv preprint arXiv:2406.05678},
  year   = {2024}
}

备注

A rethinking of Short Shifted Attention