Unlimiformer对仅解码器Transformer的适配研究
计算与语言
2024-10-04 v1 机器学习
摘要
限制当前一代大语言模型的一个突出问题是其有限的上下文长度。诸如GPT-4和Claude 2等较新的专有模型已分别引入了8k和100k的更长上下文长度;然而,尽管社区付出了努力,大多数常见模型(如LLaMA-2)的上下文长度仍为4k或更短。Unlimiformer (Bertsch et al., 2023) 是一种流行的向量检索增强方法,它将交叉注意力计算卸载到kNN索引上。然而,其主要限制是开箱即用地不兼容仅解码器Transformer。在这项工作中,我们探讨了将Unlimiformer适配到仅解码器Transformer的实际考量,并引入了一系列修改来克服这一限制。此外,我们将原有的摘要实验设置扩展到一个新任务(即自由形式问答)和一个指令微调模型(即定制的6.7B GPT模型)。我们的结果表明,这些修改在摘要任务上表现有效,其性能与上下文长度为其两倍的模型相当。最后,我们讨论了自由形式问答和指令微调模型的局限性与未来方向。
关键词
引用
@article{arxiv.2410.01637,
title = {On The Adaptation of Unlimiformer for Decoder-Only Transformers},
author = {Kian Ahrabian and Alon Benhaim and Barun Patra and Jay Pujara and Saksham Singhal and Xia Song},
journal= {arXiv preprint arXiv:2410.01637},
year = {2024}
}
备注
8 pages, 6 figures