中文

FastTTS:加速边缘 LLM 推理的测试时扩展

机器学习 2026-02-03 v2

摘要

近期推理大型语言模型(LLM)的进展正在推动智能体 AI 系统的出现。将 LLM 智能体部署在靠近终端用户的边缘设备日益必要,以保护数据隐私、实现离线使用并提供与本地上下文相关的响应式交互。然而,边缘设备上的严格内存限制将部署限制在较小的 LLM 上,而这些模型的推理能力远不如大型云端模型,从而阻碍了边缘智能体 AI 的实际部署。测试时扩展(Test-Time Scaling, TTS)提供了一条可行的解决方案,通过在推理期间分配更多计算资源来增强边缘 LLM 的推理能力。然而,当前的 TTS 方法在资源受限的设备上引入巨大的硬件性能开销,难以用于实际应用。为解决这一挑战,我们提出了 FastTTS,一个面向内存受限 LLM 推理的高效 TTS 服务系统。经过分析各种 TTS 方法的常见模式并识别其性能瓶颈后,我们引入了三项新技术:i)概念束扩展(Speculative Beam Extension),可缓解因推理路径不规则而导致的系统延迟;ii)非对称多模型内存分配(Asymmetric Multi-Model Memory Allocation),可动态平衡 token 生成和推理步骤验证之间的内存使用;iii)基于前缀的动态调度(Dynamic Prefix-Aware Scheduling),可优化推理执行以最大化 KV 缓存在搜索路径中的复用。FastTTS 基于 vLLM 提供即插即用的第三方库,使单块消费级 GPU 上的边缘 LLM 能够匹配云端模型的准确率和云端测量的延迟。全面评估显示,FastTTS 相较于 vLLM 基线实现平均 2.2 倍的 goodput 提升,延迟降低 38%--68%;它推动了内存受限边缘设备上低延迟 TTS 的边界,凸显了民主化智能体 AI 的潜力。

关键词

引用

@article{arxiv.2509.00195,
  title  = {FastTTS: Accelerating Test-Time Scaling for Edge LLM Reasoning},
  author = {Hao Mark Chen and Zhiwen Mo and Guanxi Lu and Shuang Liang and Lingxiao Ma and Wayne Luk and Hongxiang Fan},
  journal= {arXiv preprint arXiv:2509.00195},
  year   = {2026}
}

备注

Accepted at ASPLOS 2026