稀疏模型汤:一种通过模型平均改进剪枝的方法
机器学习
2024-03-26 v3 人工智能
摘要
神经网络可通过剪枝大幅压缩,产生具有更低存储与计算需求且保持预测性能的稀疏模型。模型汤(Wortsman 等,2022)通过将多个模型的参数平均为一个单一模型,在不增加推理时间的情况下提升泛化与分布外(OOD)性能。然而,同时实现稀疏性与参数平均具有挑战性,因为对任意稀疏模型取平均会因稀疏连接不同而导致整体稀疏度下降。本文通过证明在迭代幅度剪枝(IMP)的单一重训练阶段中探索不同超参数配置(如批次顺序或权重衰减)可得到适于平均的模型,且按设计共享相同稀疏连接,从而应对这些挑战。对这些模型取平均显著提升了相较于各自独立模型的泛化与 OOD 性能。在此基础上,我们提出稀疏模型汤(SMS),一种通过以先前阶段平均模型启动每个剪枝-重训练周期来合并稀疏模型的新方法。SMS 保持稀疏性,利用稀疏网络优势,具有模块化且完全可并行,并大幅改进 IMP 性能。我们进一步证明 SMS 可经调整以增强最先进的训练中剪枝方法。
引用
@article{arxiv.2306.16788,
title = {Sparse Model Soups: A Recipe for Improved Pruning via Model Averaging},
author = {Max Zimmer and Christoph Spiegel and Sebastian Pokutta},
journal= {arXiv preprint arXiv:2306.16788},
year = {2024}
}
备注
ICLR24 Camera Ready, 9 pages, 5 pages references, 16 pages appendix