云端低成本 LLM 推理:基于 KV 缓存卸载的 VM 选择
机器学习
2025-04-17 v1 分布式、并行与集群计算
摘要
LLM 推理是文本摘要、翻译和数据分析等应用的关键,但来自 AWS 等云服务提供商的 GPU 实例高昂的成本是主要负担。本文提出InferSave,一个面向云端 LLM 推理的低成本 VM 选择框架。InferSave 根据服务水平目标(SLOs)和工作负载特征优化 KV 缓存卸载策略,估算 GPU 内存需求,并推荐具有成本效益的 VM 实例。此外,计算时间校准函数(Compute Time Calibration Function, CTCF)通过调整理论与实际 GPU 性能之间的差异,提高实例选择的准确性。实验在 AWS GPU 实例上表明,对于在线工作负载,选择无需 KV 缓存卸载的低成本实例可提高成本效益最高达 73.7%,而 KV 缓存卸载可为离线工作负载节省最高达 20.19% 的成本。
引用
@article{arxiv.2504.11816,
title = {Cost-Efficient LLM Serving in the Cloud: VM Selection with KV Cache Offloading},
author = {Kihyun Kim and Jinwoo Kim and Hyunsun Chung and Myung-Hoon Cha and Hong-Yeon Kim and Youngjae Kim},
journal= {arXiv preprint arXiv:2504.11816},
year = {2025}
}
备注
10 pages, 6 figures