面向大语言模型的 hat 形设备-云协同推理框架
机器学习
2025-03-26 v1
摘要
近期大语言模型(LLM)的快速发展催生了对 LLM 服务的巨大需求。虽然传统云端 LLM 服务满足高准确率需求,但在低延迟和增强隐私方面不足。为此,我们提出 HAT,一种 novel device-cloud collaborative inference 框架,利用 U 型推理和 speculative decoding 的互补优势。HAT 将 LLM 分分为三个子模型,input 和 output 子模型配备轻量级适配器网络,部署为每个终端设备上的小型语言模型(SLM)。而包含 LLM 大部分解码层的 middle 子模型则托管在云端,进行 speculative decoding,与设备端的 SLM 协同工作。在推理过程中,HAT 在设备与云之间交换 input 或 draft tokens 的 hidden states,而非原始 token,从而产生显著的通信延迟。此外,处理长提示的 hidden states 会加剧云端的计算延迟,进一步损害推理效率。为提高效率,我们引入 prompt chunking 机制,将长提示分割为更短的块,实现并行传输和处理。此外,HAT 可动态确定处理长提示的设备的最优块大小,从而提升整体推理速度。在由 30 台 NVIDIA Jetson 设备和配备 8 台 NVIDIA A6000 GPU 的服务器组成的物理测试平台上进行广泛实验,结果表明 HAT 在基线方法中实现了显著的性能提升,将 TTFT 降低 41%至54%,TBT 降低 41%至77%。
引用
@article{arxiv.2503.18989,
title = {A Novel Hat-Shaped Device-Cloud Collaborative Inference Framework for Large Language Models},
author = {Zuan Xie and Yang Xu and Hongli Xu and Yunming Liao and Zhiwei Yao},
journal= {arXiv preprint arXiv:2503.18989},
year = {2025}
}