中文

AutoCompress:基于关键层隔离的高效Transformer压缩

机器学习 2026-04-28 v1

摘要

我们提出AutoCompress, 一种Transformer压缩方法, 源于经验发现: 在小型Transformer中, 第0层携带的任务关键信息显著高于其他所有层, NTK-based重要性得分高达3.6, 而其他所有层的最大得分为0.054——此间隔超过60倍。基于此发现, 本文提出关键层隔离(CLI)架构, 保护第0层以完整维度, 通过学习的瓶颈压缩所有中间层, 并在最终层恢复完整维度。应用于GPT-2 Medium(35480万参数)时, CLI-GPT2在WikiText-103上实现204.5的困惑度, 仅需1.438亿参数——实现2.47倍压缩比, 实现59.5%的参数降低。关键在于, 通过消融实验验证, 同等规模的统一瓶颈基线在相同训练条件下仅实现571.8的困惑度, 确认保护第0层——而非仅减少模型规模——的架构决策是性能提升的主要驱动力。代码和模型检查点已公开 disponible。

关键词

引用

@article{arxiv.2604.22786,
  title  = {AutoCompress: Critical Layer Isolation for Efficient Transformer Compression},
  author = {Archit Thorat},
  journal= {arXiv preprint arXiv:2604.22786},
  year   = {2026}
}

备注

6 pages, 2 tables. Code available at https://github.com/NotDrake100/autocompress