动态稀疏无训练:面向稀疏大语言模型的免训练微调
人工智能
2024-02-27 v3
摘要
日益增长的大语言模型(LLM)虽为即将到来的人工通用智能开辟了潜在路径,却也对其设备端部署造成了令人望而生畏的障碍。作为降低模型复杂度最成熟的预 LLM 方法之一,网络剪枝在 LLM 时代似乎落后了,这主要归因于在海量模型参数与训练数据下其昂贵的微调(或重训练)需求。为缩小这一产业-学术鸿沟,我们提出动态稀疏无训练(DSnoT),一种免训练微调方法,其在无昂贵反向传播与任何权重更新的情况下对稀疏 LLM 进行轻微更新。受动态稀疏训练启发,DSnoT 以在稀疏 LLM 之上执行迭代权重剪枝与生长的方式,最小化稠密与稀疏 LLM 间的重构误差。为实现此目的,DSnoT 特别考量了剪枝与生长所预期的重构误差下降,以及针对每个权重生长 wrt 不同输入数据的方差。该实践可于线性时间内高效执行,因其免除了 LLM 微调的反向传播需求。在 LLaMA-V1/V2、Vicuna 与 OPT 上跨多个基准的广泛实验证明了 DSnoT 在提升稀疏 LLM 性能上的有效性,尤其在高压稀疏度下。例如,在 70% 稀疏度下使用 LLaMA-7B 时,DSnoT 能以 26.79 困惑度优于最先进的 Wanda。我们的论文就如何以免训练高效方式微调稀疏 LLM 提供了新见解,并为将稀疏性的巨大潜力扩展至 LLM 开辟了新途径。代码见 https://github.com/zyxxmu/DSnoT。
引用
@article{arxiv.2310.08915,
title = {Dynamic Sparse No Training: Training-Free Fine-tuning for Sparse LLMs},
author = {Yuxin Zhang and Lirui Zhao and Mingbao Lin and Yunyun Sun and Yiwu Yao and Xingjia Han and Jared Tanner and Shiwei Liu and Rongrong Ji},
journal= {arXiv preprint arXiv:2310.08915},
year = {2024}
}
备注
Published as a conference paper at ICLR 2024