Neurocache:长程语言建模的高效向量检索
计算与语言
2024-07-03 v1 人工智能
机器学习
摘要
本文介绍Neurocache,这是一种扩展大型语言模型(LLM)有效上下文大小的方法,通过外部向量缓存存储其过去状态。类似于最近的向量检索方法,Neurocache使用高效的k近邻(kNN)算法检索相关过去状态并将其纳入注意力过程中。Neurocache在先前方法上的改进包括:(1)存储压缩后的状态,减少缓存大小;(2)执行单次检索操作,这提高了推理速度;(3)将检索窗口扩展到相邻状态,这提高了语言建模和下游任务准确性。我们的实验表明,Neurocache对于从头训练的模型以及诸如Llama2-7B和Mistral-7B等预训练模型增强缓存机制后都有效。我们还与文本检索方法进行比较,显示在单文档问答和few-shot学习任务中的改进。我们将源代码公开于:https://github.com/alisafaya/neurocache
引用
@article{arxiv.2407.02486,
title = {Neurocache: Efficient Vector Retrieval for Long-range Language Modeling},
author = {Ali Safaya and Deniz Yuret},
journal= {arXiv preprint arXiv:2407.02486},
year = {2024}
}
备注
Long paper, published at the main conference NAACL'24