中文

PIM 就是唯一需要:面向大语言模型推理的 CXL-启用无 GPU 系统

机器学习 2025-06-10 v3 人工智能 计算与语言

摘要

Large Language Model (LLM) 推理以自回归方式逐个 token 生成,其运算强度显著低于早期的 Machine Learning (ML) 模型如 encoder-only transformer 和卷积神经网络。同时,LLMs 拥有大规模参数并使用 key-value 缓存存储上下文信息。现代 LLMs 支持最高达 100 万 token 的 context window 以生成多样化的文本、音频和视频内容。每个 prompt 独特的大型 key-value 缓存需要大容量内存,限制了推理 batch size。低运算强度和受限 batch size 均要求高内存带宽。然而,当今用于 ML 模型部署的硬件系统(如 GPU 和 TPU)主要针对计算吞吐量进行优化。这一失配挑战了先进 LLMs 的高效部署,并使用户为性能不佳的内存绑定 LLM 推理任务支付高额计算资源费用。我们提出 CENT,一个 CXL-ENABLED GPU-FREE sysTem for LLM inference,它利用 CXL memory expansion 能力容纳大规模 LLM,并利用近 bank processing units 提供高内存带宽,无需昂贵的 GPU。CENT 利用可扩展 CXL 网络支持 CXL 设备之间的 peer-to-peer 和 collective communication 原语。我们实现了各种并行策略以在这些设备上分布 LLMs。与 GPU 基准(最大支持 batch size 且平均功耗相似)相比,CENT 实现 2.3×\times 更高吞吐量,能耗降低 2.9×\times。CENT 提升了 Total Cost of Ownership (TCO),每美元生成的 token 数量提高 5.2×\times

关键词

引用

@article{arxiv.2502.07577,
  title  = {Automated Capability Discovery via Foundation Model Self-Exploration},
  author = {Cong Lu and Shengran Hu and Jeff Clune},
  journal= {arXiv preprint arXiv:2502.07577},
  year   = {2025}
}