中文

QuantX:面向生成式AI工作负载的硬件感知量化框架

人工智能 2025-09-15 v2 信号处理

摘要

我们提出QuantX:一个为LLM和VLM量化定制的配方套件。其能够以最小的性能损失将模型量化到3位分辨率。QuantX中的量化策略考虑了硬件特定的约束,以实现推理期间高效的去量化,确保在运行速度、内存要求和模型准确率之间灵活的权衡。我们的结果表明,QuantX在LlaVa-v1.6模型量化到3位后,对于多个终端用户任务,性能在未量化模型的6%以内,并优于最近发布的先进量化技术。我们进一步将QuantX的某一技术集成到流行的Llama.cpp框架中,表明其在运行时方面可行,与Llama.cpp的主流量化技术相媲美。最后,本手稿提供了有关LLM量化过程的见解,这些见解激发了QuantX中所包含的各种配方和选项的动机。

关键词

引用

@article{arxiv.2505.07531,
  title  = {QuantX: A Framework for Hardware-Aware Quantization of Generative AI Workloads},
  author = {Muhammad Ahmad and Khurram Mazher and Saqib Akram and Ahmad Tameem and Saad Bin Nasir},
  journal= {arXiv preprint arXiv:2505.07531},
  year   = {2025}
}