中文

TurboRAG:基于块状文本预计算KV缓存加速检索增强生成

计算机视觉与模式识别 2024-10-11 v1 计算与语言

摘要

当前检索增强生成(RAG)系统将大量检索文档块拼接后进行预填,需进行大量计算,导致时至第一令牌延迟(TTFT)显著。为降低计算开销及TTFT,本文引入TurboRAG,一种重新设计当前RAG推理范式的新型RAG系统,首先预计算并存储文档的键值(KV)缓存,然后直接检索保存的KV缓存进行预填。因此,在推理期间消除了KV缓存的在线计算。此外,我们提供了关于掩码矩阵和位置嵌入机制的若干见解,并对预训练语言模型进行微调以维持TurboRAG的模型准确性。该方法适用于大多数现有大语言模型及其应用,无需修改模型和推理系统。实验结果表明,TurboRAG在多个RAG基准测试中,将TTFT降低最高可达传统RAG系统的9.4倍(平均为8.6倍),但保留了与标准RAG系统相当的性能。

关键词

引用

@article{arxiv.2410.07590,
  title  = {TurboRAG: Accelerating Retrieval-Augmented Generation with Precomputed KV Caches for Chunked Text},
  author = {Songshuo Lu and Hua Wang and Yutian Rong and Zhi Chen and Yaohua Tang},
  journal= {arXiv preprint arXiv:2410.07590},
  year   = {2024}
}