中文

SpecEdge:面向交互式大语言模型的可扩展边缘辅助服务框架

计算与语言 2025-11-19 v2 人工智能

摘要

大语言模型(LLM)为许多现代应用提供动力,但以规模提供服务仍昂贵且资源密集。当前的服务器中心系统忽略了边缘设备上的消费级 GPU。我们介绍 SpecEdge,一种边缘辅助推理框架,通过分块方案将 LLM 工作负载在边缘和服务器 GPU 之间分割,仅在网络上交换 token 输出。SpecEdge 采用主动边缘草拟技术,将边缘 token 创建与服务器验证重叠,并采用管线感知调度技术交错多个用户请求以提高服务器端吞吐量。实验表明,SpecEdge 通过实现 2.22 倍的服务器吞吐量,整体成本效率提升 1.91 倍,相对于仅服务器的基线,降低了 token 间延迟 11.24%,引入了面向 LLM 服务的可扩展、成本效益高的范式。代码已公开于 https://github.com/kaist-ina/specedge

关键词

引用

@article{arxiv.2505.17052,
  title  = {SpecEdge: Scalable Edge-Assisted Serving Framework for Interactive LLMs},
  author = {Jinwoo Park and Seunggeun Cho and Dongsu Han},
  journal= {arXiv preprint arXiv:2505.17052},
  year   = {2025}
}