中文

Attendre:基于记忆的 Transformer 中通过被逐查询检索实现等待式注意力以处理长上下文

计算与语言 2024-01-11 v1

摘要

随着大语言模型能够处理更复杂的输入类型,研究者近期开始探索如何高效且经济地处理可能任意长的序列。一种有效的方法是使用先进先出(FIFO)记忆来存储过往块中注意力子层的键和值,以允许后续查询进行注意力计算。然而,这种方法需要大量记忆和/或考虑特定的语言模型架构。此外,由于先前上下文中的键-值与当前查询之间存在因果性,该方法无法扩展到双向注意力,例如编码器-解码器或 PrefixLM 仅解码器架构。在本文中,我们提出使用逐出策略(如 LRA 和 LFA)来减小记忆大小并适应各种架构,同时提出 Attendre 层,这是一种通过用查询记忆(Q 记忆)中被逐出的查询来检索键-值记忆(K/V 记忆)的等待式注意力机制。作为第一步,我们使用 TriviaQA 阅读理解任务在上下文长度扩展设置中评估了该方法,并展示了该方法的有效性。

关键词

引用

@article{arxiv.2401.04881,
  title  = {Attendre: Wait To Attend By Retrieval With Evicted Queries in Memory-Based Transformers for Long Context Processing},
  author = {Zi Yang and Nan Hua},
  journal= {arXiv preprint arXiv:2401.04881},
  year   = {2024}
}