中文

重新思考视觉-语言模型的剪枝:有效稀疏性与性能恢复策略

机器学习 2024-06-26 v2 计算机视觉与模式识别

摘要

视觉-语言模型(VLMs)整合了来自多种模态的信息,并在各种任务中取得了显著成功。然而,在资源受限场景中部署大规模VLMs具有挑战性。剪枝后微调提供了一种潜在解决方案,但在VLMs中尚未得到充分探索。本研究解决了两个关键问题:如何在不同的模态特定模型之间分配稀疏性,以及如何恢复剪枝后稀疏VLMs的性能。我们的初步研究确定了两种有效的剪枝设置:对视觉和语言模型应用相同的稀疏性,以及仅剪枝语言模型。虽然LoRA微调旨在恢复稀疏模型,但由于与稀疏模型不兼容,破坏了剪枝后的稀疏性,因此面临挑战。为克服这些问题,我们提出了SparseLoRA,将稀疏性直接应用于LoRA权重。我们的实验结果表明了显著改进,包括在2:4稀疏性下提升11.3%,在非结构化70%稀疏性下提升47.6%。代码发布在:\url{https://github.com/Shwai-He/VLM-Compression}。

关键词

引用

@article{arxiv.2404.02424,
  title  = {Rethinking Pruning for Vision-Language Models: Strategies for Effective Sparsity and Performance Restoration},
  author = {Shwai He and Ang Li and Tianlong Chen},
  journal= {arXiv preprint arXiv:2404.02424},
  year   = {2024}
}