OATS:基于稀疏和低秩分解的异常感知剪枝
机器学习
2025-05-21 v3 人工智能
摘要
大规模基础模型的范式转变正在为深度学习带来新时代,尽管实际应用中取得了显著成功,但也因高内存消耗和计算成本的高昂而受到制约。为缓解这些问题,后续神经网络剪枝技术不断涌现,旨在避免高昂的再训练成本。尽管取得了可观进展,但现有方法往往随压缩比例而导致模型性能稳步下降。本文提出一种新颖的压缩大规模 transformer 模型的方法,称为 OATS,利用输入嵌入的二阶矩信息,将模型权重分解为稀疏矩阵与低秩矩阵的和。无需再训练,OATS 在压缩 Llama-3 和 Phi-3 等大型语言模型,以及 ViT 和 DINOv2 等视觉 transformer 模型时,均实现了最先进的性能;相较于其他等效压缩方法,OATS 能实现最高达 的 CPU 加速。
关键词
引用
@article{arxiv.2409.13652,
title = {OATS: Outlier-Aware Pruning Through Sparse and Low Rank Decomposition},
author = {Stephen Zhang and Vardan Papyan},
journal= {arXiv preprint arXiv:2409.13652},
year = {2025}
}