中文

DiSparse:面向多任务模型压缩的解耦稀疏化方法

计算机视觉与模式识别 2022-06-10 v1 人工智能 机器学习

摘要

尽管模型压缩与多任务学习广受欢迎,但由于任务在参数空间中的纠缠具有挑战性,如何有效压缩多任务模型较少被深入分析。本文提出 DiSparse,一种简单、有效且首创的多任务剪枝与稀疏训练方案。我们通过解耦重要性度量独立考量各任务,并在执行参数剪枝与选择时采取所有任务的一致决策。实验结果表明,相较于流行的稀疏训练与剪枝方法,其在多种配置与设定下具有更优性能。除压缩有效性外,DiSparse 也为多任务学习领域提供了有力工具。令人惊讶的是,即便在 DiSparse 施加的高模型稀疏度下,我们在若干情形中观察到优于某些专用多任务学习方法的性能。我们分析了 DiSparse 生成的剪枝掩码,观察到即便在训练开始前,各任务识别出的稀疏网络架构也惊人地相似。我们还观察到存在一个“分水岭”层,任务相关性在此急剧下降,意味着继续共享参数已无益处。我们的代码与模型将发布于:https://github.com/SHI-Labs/DiSparse-Multitask-Model-Compression。

关键词

引用

@article{arxiv.2206.04662,
  title  = {DiSparse: Disentangled Sparsification for Multitask Model Compression},
  author = {Xinglong Sun and Ali Hassani and Zhangyang Wang and Gao Huang and Humphrey Shi},
  journal= {arXiv preprint arXiv:2206.04662},
  year   = {2022}
}

备注

Accepted at CVPR 2022