AutoCompress:基于关键层隔离的高效Transformer压缩
机器学习
2026-04-28 v1
摘要
我们提出AutoCompress, 一种Transformer压缩方法, 源于经验发现: 在小型Transformer中, 第0层携带的任务关键信息显著高于其他所有层, NTK-based重要性得分高达3.6, 而其他所有层的最大得分为0.054——此间隔超过60倍。基于此发现, 本文提出关键层隔离(CLI)架构, 保护第0层以完整维度, 通过学习的瓶颈压缩所有中间层, 并在最终层恢复完整维度。应用于GPT-2 Medium(35480万参数)时, CLI-GPT2在WikiText-103上实现204.5的困惑度, 仅需1.438亿参数——实现2.47倍压缩比, 实现59.5%的参数降低。关键在于, 通过消融实验验证, 同等规模的统一瓶颈基线在相同训练条件下仅实现571.8的困惑度, 确认保护第0层——而非仅减少模型规模——的架构决策是性能提升的主要驱动力。代码和模型检查点已公开 disponible。
关键词
引用
@article{arxiv.2604.22786,
title = {AutoCompress: Critical Layer Isolation for Efficient Transformer Compression},
author = {Archit Thorat},
journal= {arXiv preprint arXiv:2604.22786},
year = {2026}
}
备注
6 pages, 2 tables. Code available at https://github.com/NotDrake100/autocompress