Open-TQ-Metal:面向 Apple Silicon 的长上下文 LLM 推理的融合压缩域注意力
机器学习
2026-04-21 v1
摘要
我们提出 Open-TQ-Metal,是 Apple Silicon 上首个实现融合压缩域注意力的框架,使其能够在单台配备 64GB 内存的消费级 Mac 上进行 128K 上下文的 Llama 3.1 70B 模型推理——这种配置在所有现有推理框架中都不可能实现。Open-TQ-Metal 将 KV 缓存即时量化为 int4,并通过自定义 Metal 计算着色器直接在压缩表示上计算注意力,消除所有中间去量化矩阵。我们在覆盖两个模型家族(Gemma 4 31B 和 Llama 3.1 70B)的 330 项实验中,融合的 sdpa_int4 kernel 相对于去量化后注意力基线实现了 48 倍注意力加速,将 KV 缓存内存从 40 GB 降至 12.5 GB(3.2 倍压缩),并保持与 FP16 推理完全相同的 top-1 token 预测。我们进一步提供了 KV 缓存量化方法的首次跨架构分析,揭示注意力尺度因子——而非模型规模——决定了像 PolarQuant 这样的角度量化方案是成功还是失败,Gemma 4 的 attn_scale=1.0 将方向性误差放大 25-100 倍于 Llama 标准的 1/sqrt(d) 缩放。
引用
@article{arxiv.2604.16957,
title = {Open-TQ-Metal: Fused Compressed-Domain Attention for Long-Context LLM Inference on Apple Silicon},
author = {Sai Vegasena},
journal= {arXiv preprint arXiv:2604.16957},
year = {2026}
}
备注
8 pages, 8 figures, 8 tables. Code: https://github.com/svv232/gemma4metal and https://github.com/svv232/turboquant-llama3.170B