中文

垃圾DNA假说:剪枝小型预训练权重不可逆转且单调地损害大语言模型中的“困难”下游任务

机器学习 2026-05-01 v4 人工智能

摘要

我们通过采用一种以任务为中心的新视角来研究大语言模型(LLMs)的预训练权重,提出垃圾DNA假说。人们普遍认为LLM中的权重存在显著冗余,从而认为可通过剪枝移除相当比例的参数而不损害性能。与这一信念相反,本文提出反论:预训练模型权重中小幅值权重编码了应对困难下游任务所必需的重要知识——表现为随着我们按幅值剪枝更多预训练权重,不同难度下游任务性能下降之间的单调关系。此外,我们揭示这些看似无关紧要的权重即便允许下游持续训练,也会导致困难任务中不可修复的知识丢失与性能退化。有趣的是,我们的评估表明另一种流行的压缩方法即量化未能展现类似的单调效应,也不能如此有说服力地解耦该任务难度信息。为形式化研究,我们引入若干可量化指标来衡量下游任务难度:(1)同一任务类别内,以及(2)不同任务类别间。我们大量实验在多样的模型规模、任务、数据集乃至剪枝方法上证实了垃圾DNA假说。代码见:https://github.com/VITA-Group/Junk_DNA_Hypothesis.git。

关键词

引用

@article{arxiv.2310.02277,
  title  = {Junk DNA Hypothesis: Pruning Small Pre-Trained Weights Irreversibly and Monotonically Impairs "Difficult" Downstream Tasks in LLMs},
  author = {Lu Yin and Ajay Jaiswal and Shiwei Liu and Souvik Kundu and Zhangyang Wang},
  journal= {arXiv preprint arXiv:2310.02277},
  year   = {2026}
}

备注

Published at ICML 2024