中文

基于Hessian感知量化与CPU-GPU协同的高效边缘LLM部署

机器学习 2025-08-12 v1 人工智能

摘要

随着大语言模型(LLM)在自然语言处理和多模态任务方面的突破性进展,高效地在资源受限的边缘设备上部署它们已成为关键挑战。Mixture of Experts(MoE)架构通过稀疏激活提高模型容量,但在实际部署中面临两个主要难题:(1)激活分布中大量离子导致对激活和权重量化精度严重下降,显著影响推理性能;(2)在内存受限情况下,专家模块的高效卸载和协同推理难以在延迟和吞吐量之间取得平衡。为解决这些问题,本文提出一种基于Hessian感知量化(HAQ)和CPU-GPU协同推理的高效MoE边缘部署方案。首先,通过引入平滑Hessian矩阵量化,实现激活和权重的联合8位量化,显著减轻离子导致的精度损失,同时确保在主流硬件上的高效实现。其次,我们设计了基于专家层级的协同卸载和推理机制,结合专家激活路径统计,实现了专家模块在CPU和GPU之间的高效部署和调度,大幅降低了内存占用和推理延迟。广泛的实验验证表明,在Wikitext2和C4等数据集上,低位量化模型的推理精度接近全精度模型,GPU内存使用减少约60%,推理延迟显著提升。

关键词

引用

@article{arxiv.2508.07329,
  title  = {Efficient Edge LLMs Deployment via HessianAware Quantization and CPU GPU Collaborative},
  author = {Tuo Zhang and Ning Li and Xin Yuan and Wenchao Xu and Quan Chen and Song Guo and Haijun Zhang},
  journal= {arXiv preprint arXiv:2508.07329},
  year   = {2025}
}