AlayaDB:面向高效高质量长上下文 LLM 推理的数据基础
人工智能
2025-04-15 v1 数据库
信息检索
摘要
AlayaDB 是一款专为大语言模型 (LLM) 在各种不同服务水平目标 (SLO) 下的高效高质量长上下文推理而设计的向量数据库系统。具体而言,它将 KV 缓存和注意力计算从 LLM 推理系统中解耦,并将其封装为一种新型向量数据库系统。对于模型即服务 (MaaS) 提供商,AlayaDB 在较少的硬件资源下,能够为各种负载提供更高的生成质量,当与现有替代方案(如 KV 缓存解耦、基于检索的稀疏注意力)进行比较时表现更为出色。AlayaDB 的核心在于,将 LLM 推理的注意力计算和缓存管理抽象为查询处理过程,并通过原生查询优化器来优化性能。本文通过 (i) 来自行业合作伙伴的三个实际应用案例,和 (ii) 在 LLM 推理基准测试上的大量实验结果,展示了 AlayaDB 的有效性。
引用
@article{arxiv.2504.10326,
title = {AlayaDB: The Data Foundation for Efficient and Effective Long-context LLM Inference},
author = {Yangshen Deng and Zhengxin You and Long Xiang and Qilong Li and Peiqi Yuan and Zhaoyang Hong and Yitao Zheng and Wanting Li and Runzhong Li and Haotian Liu and Kyriakos Mouratidis and Man Lung Yiu and Huan Li and Qiaomu Shen and Rui Mao and Bo Tang},
journal= {arXiv preprint arXiv:2504.10326},
year = {2025}
}
备注
14 pages, 12 figures, conference