PromptTuner:面向 LLM 提示调优的 SLO 感知弹性系统
分布式、并行与集群计算
2026-03-06 v1
摘要
提示调优已成为增强大型语言模型(LLM)在下游任务上性能的热门策略。许多 IT 企业现已提供提示调优即服务(Prompt-Tuning-as-a-Service),以满足日益增长的在下游任务中对 LLM 提示调优需求。其主要目标是在满足用户服务水平目标(SLO)的同时,降低资源配置成本。然而,我们的特征分析表明,现有深度学习资源管理系统对于 LLM 提示调优工作负载而言,仍不足以优化这些目标。本文我们引入 PromptTuner,一个 SLO 感知弹性系统,用于优化 LLM 提示调优。它包含两个创新点。(1)我们设计了一个提示库(Prompt Bank),以识别高效初始提示,以加速提示调优的收敛。(2)我们开发了一个工作负载调度器(Workload Scheduler),以实现快速资源分配,以减少 SLO 违规和资源成本。在我们的评估中,PromptTuner 相较于 INFless 和 ElasticFlow 分别将 SLO 违规降低了 4.0 倍和 7.9 倍,成本降低了 1.6 倍和 4.5 倍。
关键词
引用
@article{arxiv.2603.05087,
title = {PromptTuner: SLO-Aware Elastic System for LLM Prompt Tuning},
author = {Wei Gao and Peng Sun and Dmitrii Ustiugov and Tianwei Zhang and Yonggang Wen},
journal= {arXiv preprint arXiv:2603.05087},
year = {2026}
}