中文

两个优于一个:基于多粒度自注入的上下文窗口扩展

计算与语言 2024-10-28 v1 人工智能 机器学习

摘要

当代大语言模型有限的上下文窗口仍然是其在各个领域更广泛应用的主要障碍。虽然对长上下文数据进行持续预训练是一种直接有效的解决方案,但它在数据获取和计算资源方面会带来巨大的成本。为了缓解这个问题,我们提出了 SharedLLM,一种基于多粒度上下文压缩和查询感知信息检索设计理念的新方法。SharedLLM 由两个短上下文大语言模型(例如 LLaMA-2)组成,称为上模型和下模型。下模型充当压缩器,而上模型充当解码器。上模型接收来自下模型的压缩后的多粒度上下文信息,并对正在运行的文本进行上下文感知建模。压缩器和解码器之间的信息传输仅发生在最低层,以避免下模型中的长前向路径和上模型中的冗余交叉注意力模块。基于这种架构,我们引入了一种专门的树状数据结构,以有效地对文本块的多粒度上下文信息进行编码、存储和检索。这种结构与搜索算法相结合,能够根据输入查询从树的各个层级快速编码和检索相关信息。发送方和接收方源自同一个大语言模型层的整个过程被称为自注入。

关键词

引用

@article{arxiv.2410.19318,
  title  = {Two are better than one: Context window extension with multi-grained self-injection},
  author = {Wei Han and Pan Zhou and Soujanya Poria and Shuicheng Yan},
  journal= {arXiv preprint arXiv:2410.19318},
  year   = {2024}
}

备注

The code is available at https://github.com/Clement25/SharedLLM