中文

TernaryLM:基于原生 1.5 位量化与自适应分层缩放的内存高效语言模型

计算与语言 2026-03-30 v2 人工智能

摘要

大型语言模型(LLM)取得了显著的性能,但需要大量计算资源,限制了在边缘设备和资源受限环境中的部署。我们提出了 TernaryLM,一个 1.32 亿参数的 transformer 模型,通过原生三值量化 {-1, 0, +1}(有效精度约 1.58 位,log2(3))实现显著的内存降低,同时不牺牲语言建模能力。不同于后训练量化方法对预训练的全精度模型进行量化,TernaryLM 使用直流估计器和自适应分层缩放因子,从头开始学习量化感知表示。我们的实验表明:(1)在 TinyStories 上验证困惑度为 58.42,交叉种子标准差为 +/- 0.17 PPL,确认优化稳定;(2)在 MRPC 上实现 82.47% 的 F1 分数,超越 DistilBERT,尽管使用了 55 倍更少的预训练数据;(3)实现 2.4 倍内存降低(498 MB vs 1,197 MB 的 FP32 模型),且延迟持平;(4)三值约束产生隐式正则化效应,训练/验证比为 1.05 倍,而 FP32 基准为 3.51 倍,表明离散权重在小语料库上防止了过拟合。我们提供了分层稀疏度分析,发现中间 transformer 层(L5-L9)实现 60-62% 的量化稀疏度,而边界层为 45-55%,为非均匀精度分配建立了可操作的设计原则。我们的实现和训练好的模型 publicly available at https://github.com/1nisharg/TernaryLM-Memory-Efficient-Language-Modeling。

关键词

引用

@article{arxiv.2602.07374,
  title  = {TernaryLM: Memory-Efficient Language Modeling via Native 1.5-Bit Quantization with Adaptive Layer-wise Scaling},
  author = {Nisharg Nargund and Priyesh Shukla},
  journal= {arXiv preprint arXiv:2602.07374},
  year   = {2026}
}