中文

Chameleon:一种面向检索增强语言模型的异构解耦加速器系统

机器学习 2025-03-26 v4 人工智能 硬件体系结构 计算与语言

摘要

检索增强语言模型(RALM)将大语言模型(LLM)与向量数据库结合,在文本生成过程中检索特定于上下文的知识。该策略即使使用较小模型也能实现令人印象深刻的生成质量,从而将计算需求降低数个数量级。为高效且灵活地服务 RALM,我们提出 Chameleon,一种在解耦架构中集成 LLM 与向量搜索加速器的异构加速器系统。异构性确保推理与检索的高效服务,而解耦允许独立扩展 LLM 与向量搜索加速器以满足多样的 RALM 需求。我们的 Chameleon 原型在 FPGA 上实现向量搜索加速器,将 LLM 推理分配给 GPU,并以 CPU 作为集群协调器。在各种 RALM 上的评估表明,与混合 CPU-GPU 架构相比,Chameleon 的延迟降低达 2.16×\times,吞吐量加速达 3.18x。这一 promising 结果为在未来 RALM 系统中采用异构加速器不仅用于 LLM 推理也用于向量搜索铺平了道路。

关键词

引用

@article{arxiv.2310.09949,
  title  = {Chameleon: a Heterogeneous and Disaggregated Accelerator System for Retrieval-Augmented Language Models},
  author = {Wenqi Jiang and Marco Zeller and Roger Waleffe and Torsten Hoefler and Gustavo Alonso},
  journal= {arXiv preprint arXiv:2310.09949},
  year   = {2025}
}

备注

Accepted by VLDB 2025