中文

SmartQuant:基于 CXL 的可运行时配置权重量化 AI 模型存储

机器学习 2024-08-20 v2 人工智能 硬件体系结构

摘要

最近的研究揭示了在生成式 AI 模型(如 Transformer)进行推理时,不同权重的重要性 exhibits 显著的情境依赖性变异。这自然体现了可适配性地配置权重量化以提高生成式 AI 推理效率的潜在前景。虽然可配置权重量化可以轻松利用现代 GPU 和 AI 加速器中可变精度算术的硬件支持,但少数先前研究如何利用可变权重量化按比例提升 AI 模型内存访问速度和能源效率仍存疑问。鉴于 CXL 生态系统的快速成熟,本工作开发了一种 CXL 基于的设计解决方案以填补这一空白。关键在于允许 CXL 内存控制器在支持和利用运行时可配置权重量化方面发挥积极作用。以 Transformer 作为代表性生成式 AI 模型,我们进行了实验,充分证明了所提出设计方案的有效性。

关键词

引用

@article{arxiv.2407.15866,
  title  = {SmartQuant: CXL-based AI Model Store in Support of Runtime Configurable Weight Quantization},
  author = {Rui Xie and Asad Ul Haq and Linsen Ma and Krystal Sun and Sanchari Sen and Swagath Venkataramani and Liu Liu and Tong Zhang},
  journal= {arXiv preprint arXiv:2407.15866},
  year   = {2024}
}