中文

ModeSwitch-LLM:单 GPU 上跨模式 LLM 推理的轻量级相位感知控制器

机器学习 2026-05-25 v1 计算与语言 性能

摘要

ModeSwitch-LLM 是一种轻量级请求边界控制器,用于提高单 GPU 大语言模型推理效率,通过将每个请求路由到合适的固定推理模式。该系统在 FP16、量化模式、投机解码以及如 GPTQ 加前缀缓存和 INT8 加连续批处理等混合模式之间进行选择,利用廉价的工作负载级特征。我们在 Meta-Llama-3.1-8B-Instruct 于单张 NVIDIA A100 GPU 上评估了 ModeSwitch-LLM。在部署风格的合成工作负载上,线上控制器相对于 FP16 实现了 2.10 倍的平均延迟加速和 0.48 的平均能耗比,相当于每标记能耗降低 51.7%。在用于质量门控的自动基准测试上,准确率接近 FP16,平均偏差为 +0.17 个百分点。我们还评估了轻量级学习路由器,但发现它们不明显优于基于规则的控制器,因为它们增加了路由开销,并且更常选择违反质量、能耗或内存约束的模式。这些结果表明,简单的请求感知路由可以在无需重新训练模型或更改其体系结构的情况下,从现有推理模式中恢复大量效率。

关键词

引用

@article{arxiv.2605.23057,
  title  = {ModeSwitch-LLM: A Lightweight Phase-Aware Controller for Cross-Mode LLM Inference on a Single GPU},
  author = {Aman Sunesh and Ali Alshehhi and Hivansh Dhakne},
  journal= {arXiv preprint arXiv:2605.23057},
  year   = {2026}
}

备注

10 pages main text, 11 pages including references, 5 figures, 3 tables. Preprint