Litespark 消费级 CPU 推理:面向三值神经网络的定制 SIMD 内核
计算与语言
2026-05-08 v1 人工智能
摘要
大型语言模型(LLM)已变革了人工智能,但其计算需求对大多数用户而言依然高昂。标准推理需要昂贵的数据中心 GPU 或云 API 访问,导致超过十亿台个人计算机在 AI 工作负载上未被充分利用。三值模型提供了一条可行路径:其权重被限制为 {-1, 0, +1},理论上消除了浮点乘法的需求。然而,现有框架未能利用这一结构,将三值模型视为密集的浮点网络。我们通过定制的 SIMD 内核填补了这一空白,利用现代 CPU 上可用的整数点积指令,以简单的加减法运算替代矩阵乘法。我们的实现 Litespark-Inference 可通过 pip 安装,并与 Hugging-Face 直接集成。在 Apple Silicon 上,与标准 PyTorch 推理相比,其首 token 生成时间快 9.2 倍,吞吐量高 52 倍,内存减少 14 倍,并在 Intel 和 AMD 处理器上取得了相似的加速效果。
引用
@article{arxiv.2605.06485,
title = {Litespark Inference on Consumer CPUs: Custom SIMD Kernels for Ternary Neural Networks},
author = {Nii Osae Osae Dade and Tony Morri and Moinul Hossain Rahat and Sayandip Pal},
journal= {arXiv preprint arXiv:2605.06485},
year = {2026}
}