中文

从比特到芯片:基于 LLM 的硬件感知量化智能体以简化 LLM 部署

机器学习 2026-04-07 v2

摘要

模型部署,特别是大型语言模型(LLM),正变得越来越受广泛用户的青睐,包括那些没有专业专业知识的用户。然而,由于某些硬件的资源限制,在保持较大模型高精度的同时满足硬件要求仍是一个重大挑战。模型量化技术有助于缓解内存和计算瓶颈,但量化模型添加的复杂性和部署过程进一步恶化了这些挑战,使得该过程对大多数用户来说都不够友好。我们引入硬件感知量化智能体(HAQA),一个自动化框架,利用 LLM 简化整个量化和部署流程,通过高效超参数调优和硬件配置实现部署质量和易用性的提升,从而服务于广泛的用户群体。我们的结果显示,在 Llama 上,HAQA 实现推理速度提升最高可达 2.3 倍,同时吞吐量和准确率均高于未优化模型。此外,HAQA 设计用于在 diverse 硬件平台上实现自适应量化策略,能够自动发现即使看似反直觉的最佳设置,从而减少大量手动工作,显示出卓越的适应性。代码将公开发布。

关键词

引用

@article{arxiv.2601.03484,
  title  = {From Bits to Chips: An LLM-based Hardware-Aware Quantization Agent for Streamlined Deployment of LLMs},
  author = {Kaiyuan Deng and Hangyu Zheng and Minghai Qing and Kunxiong Zhu and Gen Li and Yang Xiao and Lan Emily Zhang and Linke Guo and Bo Hui and Yanzhi Wang and Geng Yuan and Gagan Agrawal and Wei Niu and Xiaolong Ma},
  journal= {arXiv preprint arXiv:2601.03484},
  year   = {2026}
}