HA-RAG: 基于热度的混合精度与数据放置的RAG加速
机器学习
2025-10-27 v1 人工智能
摘要
检索增强生成(RAG)通过利用外部知识库提高模型输出准确性,是解决大语言模型(LLM)中幻觉问题和知识更新延迟的有效方案。然而,外部知识库的引入给RAG带来了长上下文处理的挑战,显著增加了内存消耗和推理延迟。现有研究通过预计算知识库的键值对(KV)并在推理时按需加载来加速推理。基于外部知识库中不同KV块访问频率的差异,本文提出了一种基于热度的RAG(HA-RAG)推理优化系统。首先,利用KV块的数值分布,我们引入了一种基于热度的混合精度压缩与加载方法,以减少磁盘I/O和内存访问开销。其次,我们设计了一种基于热度的数据放置策略,优先将频繁访问的KV块存储在高速度内存中,以提高数据访问效率。实验结果表明,与TurboRAG相比,所提出的HA-RAG在首令牌延迟(TTFT)上实现了平均2.10倍、最高10.49倍的加速,且精度损失可忽略不计。
引用
@article{arxiv.2510.20878,
title = {HA-RAG: Hotness-Aware RAG Acceleration via Mixed Precision and Data Placement},
author = {Danying Ge and Jianhua Gao and Yixue Yang and Weixing Ji},
journal= {arXiv preprint arXiv:2510.20878},
year = {2025}
}
备注
13 pages,16 figures,2 tables