中文

T-SAR:通过原位SIMD ALU重组实现纯CPU三元LLM推理的全栈协同设计

硬件体系结构 2025-11-18 v1 机器学习

摘要

大语言模型的最新进展已超出主要使用CPU的边缘平台的计算和存储能力,从而对高效且可扩展的部署提出了挑战。虽然三元量化能显著节省资源,但现有的CPU解决方案严重依赖基于内存的查找表,这限制了可扩展性,而FPGA或GPU加速器对于边缘应用来说仍然不切实际。本文提出了T-SAR,这是首个通过重新利用SIMD寄存器文件进行动态寄存器内LUT生成,并以最小的硬件修改在CPU上实现可扩展三元LLM推理的框架。T-SAR消除了内存瓶颈并最大化了数据级并行性,在GEMM延迟和GEMV吞吐量上分别实现了5.6-24.5倍和1.1-86.2倍的提升,而SIMD单元的功耗和面积开销仅为3.2%和1.4%。T-SAR的能效最高可达NVIDIA Jetson AGX Orin的2.5-4.9倍,为在边缘平台上实现高效的LLM推理提供了一种实用方法。

关键词

引用

@article{arxiv.2511.13676,
  title  = {T-SAR: A Full-Stack Co-design for CPU-Only Ternary LLM Inference via In-Place SIMD ALU Reorganization},
  author = {Hyunwoo Oh and KyungIn Nam and Rajat Bhattacharjya and Hanning Chen and Tamoghno Das and Sanggeon Yun and Suyeon Jang and Andrew Ding and Nikil Dutt and Mohsen Imani},
  journal= {arXiv preprint arXiv:2511.13676},
  year   = {2025}
}

备注

Accepted to DATE 2026