中文

加速检索增强生成

计算与语言 2024-12-23 v1 人工智能 硬件体系结构 分布式、并行与集群计算 信息检索

摘要

检索增强生成(RAG)是解决大语言模型(LLM)幻觉问题并提升准确性的一种日益流行的解决方案,通过从外部知识源(如网页)检索信息来增强 LLM。本文概述了几种 RAG 执行管道,揭示其检索与生成阶段之间复杂的相互作用。我们展示,尽管精确检索方案开销较大,但它们可以在保持相同端到端准确性的同时,通过发送更小但更准确的文档列表给生成模型,从而在推理时间上优于近似检索变体。这一观察激励我们加速 RAG 的精确最近邻搜索。在本工作中,我们设计了一种智能知识存储(IKS),一种类型为 2 的 CXL 设备,实现一种规模化的近内存加速架构,并在主机 CPU 与近内存加速器之间引入一种新型的缓存一致接口。IKS 在 512GB 向量数据库上相较于在英特尔萃芹(Sapphire Rapids)CPU 上执行的搜索速度提升 13.4 倍至 27.9 倍。这种更高的搜索性能翻译为对各类 RAG 应用的端到端推理时间降低 1.7 倍至 26.3 倍。IKS 本质上是一种内存扩充器,其内部 DRAM 可被解聚,用于运行在服务器上的其他应用程序,以防止 DRAM——即今天服务器中最昂贵的组件——闲置。

关键词

引用

@article{arxiv.2412.15246,
  title  = {Accelerating Retrieval-Augmented Generation},
  author = {Derrick Quinn and Mohammad Nouri and Neel Patel and John Salihu and Alireza Salemi and Sukhan Lee and Hamed Zamani and Mohammad Alian},
  journal= {arXiv preprint arXiv:2412.15246},
  year   = {2024}
}