中文

推动 AI-PC 和英特尔 GPU 上 LLM 推理的极限

人工智能 2026-01-27 v2 机器学习 性能

摘要

超低位 LLM 模型 (1/1.58/2 位) 的出现,能够在相同模型规模下匹配其全精度版本的 perplexity 和最终任务性能,正在 ushering 在边缘设备和 AI PC 等资源受限环境中进行 LLM 推理的新时代。尽管这些量化进步为降低延迟、内存、吞吐量和能源消耗方面的成本效益模型提供了保证,但当前用于部署这些模型的 SOTA 推理运行时 (如 bitnet.cpp) 的计算效率仍未得到充分探索。本文我们采用自下而上的方法:首先设计并实现针对现代 CPU 优化的 1 位和 2 位微内核,实现各种 CPU 平台的峰值计算效率。我们将这些微内核集成到当前 LLM 推理框架 PyTorch-TPP 中,展示了使用 2 位模型进行端到端推理结果相较于当前 SOTA 运行时 bitnet.cpp 可提升最高达 2.2 倍,相较于 16 位模型推理可实现最高 7 倍加速。随后我们将其扩展到英特尔 GPU,设计并实现混合精度 2 位 GEMM 内核,显示其性能接近最优。我们将优化后的 Xe2 内核集成到 vLLM 框架作为量化插件中进行评估,针对各种 LLM 模型和 Xe2 GPU 进行端到端 LLM 推理评估。根据模型和平台的不同,GEMM 时间相较于 BF16 案例可减少 4 倍至 8 倍,端到端延迟相较于 BF16 执行可实现最高 6.3 倍加速。我们的优化运行时推动了 AI PC 和英特尔 Xe GPU 上 LLM 推理的前沿,为在资源受限环境中部署超低位 LLM 模型铺平了道路。

关键词

引用

@article{arxiv.2508.06753,
  title  = {Pushing the Envelope of LLM Inference on AI-PC and Intel GPUs},
  author = {Evangelos Georganas and Dhiraj Kalamkar and Alexander Heinecke},
  journal= {arXiv preprint arXiv:2508.06753},
  year   = {2026}
}