在关系型数据分析工作负载中优化LLM查询
机器学习
2025-04-10 v2 数据库
摘要
批处理数据分析是大型语言模型日益增长的应用场景。LLM使用户能够在大型数据集上执行各种自然语言任务,如分类、实体提取和翻译。然而,LLM推理成本高昂且速度缓慢:例如,运行Llama3-8B的NVIDIA L4 GPU每秒只能处理6 KB的文本,处理15 GB的数据大约需要一天时间;在OpenAI的GPT-4o上处理类似数量的数据大约花费1万美元。在本文中,我们提出了新颖的技术,可以显著降低关系型数据分析工作负载中LLM调用的成本。我们的核心贡献是开发了高效的算法,通过重排输入表中各行及每行内各字段的顺序,在执行LLM服务时最大化键值缓存复用。因此,我们的方法可以轻松应用于现有的分析系统和服务平台。我们的评估表明,在使用Llama 3模型的多样化基于LLM的查询基准上,我们的解决方案在作业完成时间上可实现高达3.4倍的提升。在OpenAI和Anthropic的定价模型下,我们的解决方案还实现了32%的成本节省。
引用
@article{arxiv.2403.05821,
title = {Optimizing LLM Queries in Relational Data Analytics Workloads},
author = {Shu Liu and Asim Biswal and Amog Kamsetty and Audrey Cheng and Luis Gaspar Schroeder and Liana Patel and Shiyi Cao and Xiangxi Mo and Ion Stoica and Joseph E. Gonzalez and Matei Zaharia},
journal= {arXiv preprint arXiv:2403.05821},
year = {2025}
}