大型语言模型需要内容分发网络吗?
计算与语言
2024-10-22 v2 人工智能
摘要
随着大型语言模型 (LLM) 的使用迅速扩展,补充各种 LLM 查询所需的知识范围也在扩大。因此,在 LLM 推理中实现灵活高效的新知识注入至关重要。存在三种高级选项: 将知识嵌入 LLM 的权重中(即微调), 将知识作为 LLM 文本输入的一部分包含在内(即上下文学习),或在预填充阶段将新知识的 KV cache 注入 LLM。本文认为,尽管微调和上下文学习很受欢迎,但使用 KV cache 作为知识媒介可以同时实现更模块化的知识注入管理,以及低成本、快速响应的高效 LLM 服务。为了实现这些益处,我们设想了一种知识分发网络 (KDN),这是 LLM 服务中的一种新系统组件,可跨 LLM 引擎及其他计算和存储资源动态优化 KV cache 的存储、传输和组合。我们相信,就像 Akamai 等内容分发网络 (CDN) 通过其高效的数据分发实现了互联网生态系统的成功一样,KDN 也将通过其高效的知识分发对 LLM 应用的成功至关重要。我们已在 https://github.com/LMCache/LMCache 开源了一个 KDN 原型。
引用
@article{arxiv.2409.13761,
title = {Do Large Language Models Need a Content Delivery Network?},
author = {Yihua Cheng and Kuntai Du and Jiayi Yao and Junchen Jiang},
journal= {arXiv preprint arXiv:2409.13761},
year = {2024}
}