AXELRAM:量化一次,永不反量化
机器学习
2026-04-06 v1 硬件体系结构
摘要
我们提出了AXELRAM,一种智能SRAM宏架构,可直接从量化后的KV缓存索引计算注意力分数而无需反量化。关键使能器是设计时固定的码本:基于正交变换的量化将每个坐标的分布集中到N(0,1/d),因此最优量化器仅取决于维度d和位宽b,而与输入数据无关。非对称路径设计——写入时变换、读取时查表且无需逆变换——将每次查询的乘法操作减少了102.4倍(数学恒等式)。通过多种子评估(10个种子×3个模型),我们发现符号模式敏感性会在某些模型(Qwen2.5-3B)上导致灾难性的PPL尖峰(Delta>50),而其他模型(LLaMA-3.1-8B)则完全稳定。这一现象将SpinQuant关于权重量化中旋转方差的观察扩展到KV缓存领域,且该效应在定性上更为严重。我们追溯根本原因为层间范数异质性,并提出了一种无梯度的符号模式选择方法(200个候选、8个校准样本、一次性),在不增加任何硬件成本的情况下消除了灾难性尖峰。所有源代码可在https://github.com/Axelidea/AXELRAM获取。
引用
@article{arxiv.2604.02638,
title = {AXELRAM: Quantize Once, Never Dequantize},
author = {Yasushi Nishida},
journal= {arXiv preprint arXiv:2604.02638},
year = {2026}
}
备注
6 pages, 3 figures, 3 tables. Code: https://github.com/Axelidea/AXELRAM