BALF:用于免微调模型压缩的预算化激活感知低秩分解
机器学习
2025-10-14 v2
摘要
神经网络压缩技术通常需要昂贵的微调或搜索过程,使其在商用硬件上不切实际。受近期 LLM 压缩研究的启发,我们提出了一种通用的激活感知分解框架,可应用于广泛的层范围。此外,我们引入了一种可扩展的预算化秩分配器,允许对压缩目标进行灵活控制(例如,保留 50% 的参数)且无额外开销。这些组件共同构成了 BALF,一种无需微调即可压缩模型的高效流水线。我们展示了其在多种规模和架构上的有效性,从 CIFAR-10 上的 ResNet-20 到 ImageNet 上的 ResNeXt-101 和视觉 Transformer,并表明它在免微调机制下取得了优异的结果。例如,BALF 将 ResNeXt-101 上的 FLOPs 减少了 45%,而 top-1 准确率仅下降 1 个百分点。
引用
@article{arxiv.2509.25136,
title = {BALF: Budgeted Activation-Aware Low-Rank Factorization for Fine-Tuning-Free Model Compression},
author = {David González-Martínez},
journal= {arXiv preprint arXiv:2509.25136},
year = {2025}
}