TernaryLLM:分段化大语言模型
机器学习
2024-06-12 v1
摘要
大语言模型 (LLM) 在自然语言处理 (NLP) 任务上取得了显著的性能,但受限于高计算成本和内存需求。分段化是一种极端量化方式,可减少内存使用并实现能源效率的浮点运算。然而,由于权重和激活中的离群值,将分段化应用于 LLM 面临挑战。本文观察到权重中的非对称离群值和非零均值,引入可学习的双重分段化 (Dual Learnable Ternarization, DLT),使比例和偏移均可学习。我们还提出了面向离群值的特征知识蒸馏 (Outlier-Friendly Feature Knowledge Distillation, OFF),以恢复极低位量化中丢失的信息。所提出的 OFF 可融合语义信息且对离群值不敏感。OFF 的核心是通过余弦相似性最大化 ternarized 模型与浮点模型特征之间的互信息。广泛的实验表明,我们的 TernaryLLM 在标准文本生成和零样本基准测试中优于前一种低位量化方法。具体而言,对于最强大的开源模型之一 LLaMA-3,我们的方法 (W1.58A16) 相较于前一种最先进方法 (W2A16) 在 C4 的 perplexity 提升 5.8,在零样本任务上的平均准确率提升 8.2%。
引用
@article{arxiv.2406.07177,
title = {TernaryLLM: Ternarized Large Language Model},
author = {Tianqi Chen and Zhe Li and Weixiang Xu and Zeyu Zhu and Dong Li and Lu Tian and Emad Barsoum and Peisong Wang and Jian Cheng},
journal= {arXiv preprint arXiv:2406.07177},
year = {2024}
}