中文

为参数共享用于模型压缩辩护

机器学习 2023-10-19 v1

摘要

在考虑模型架构时,有几种方法可减小其内存占用。历史上,流行的方法包括选择更小的架构以及通过剪枝创建稀疏网络。近来,随机参数共享(RPS)方法在训练初期用于模型压缩日益受到关注。本文中,我们全面评估了 RPS、剪枝技术以及构建更小模型之间内存与准确率的权衡。我们的发现表明,RPS 既与数据和模型无关,又在整个压缩范围内持续优于或匹敌更小模型及所有适度知情的剪枝策略,如 MAG、SNIP、SYNFLOW 和 GRASP。这一优势在更高压缩场景中尤为明显。值得注意的是,即便与高度知情的剪枝技术如 Lottery Ticket Rewinding(LTR)相比,RPS 在高压缩设置下也表现出更优性能。这指出了 RPS 相对于稀疏模型所享有的固有容量优势。理论上,我们确立 RPS 作为相比线性模型剪枝在内存高效表示上更优的技术。本文主张向基于 RPS 的模型范式转变。在对 RPS 的严格评估中,我们发现了最先进 RPS 技术 ROAST 的问题,具体关于稳定性(ROAST 对初始化超参数敏感,常导致发散)和帕累托连续性(ROAST 在零压缩时无法恢复原始模型准确率)。我们可证明地解决了这两个问题。我们将融入我们改进的修正版 RPS 称为 STABLE-RPS。

关键词

引用

@article{arxiv.2310.11611,
  title  = {In defense of parameter sharing for model-compression},
  author = {Aditya Desai and Anshumali Shrivastava},
  journal= {arXiv preprint arXiv:2310.11611},
  year   = {2023}
}