中文

MULTIFLOW:转向任务无关的视觉-语言剪枝

计算机视觉与模式识别 2024-04-09 v1

摘要

视觉-语言模型(Vision-Language models, VLMs)虽然在迁移学习中表现优异,但由于参数量巨大而带来了高昂的计算成本。为了解决这一问题,通过模型剪枝移除参数是一种可行的解决方案。然而,现有的 VLM 剪枝技术是特定于任务的,因此对于每个新的目标任务都需要从头开始剪枝网络。在这项工作中,我们探索了一个新方向:任务无关的视觉-语言剪枝(Task-Agnostic Vision-Language Pruning, TA-VLP)。给定一个预训练的 VLM,目标是找到一个唯一的、可迁移至多个未知下游任务的剪枝对应模型。在这种具有挑战性的设置中,预训练模型中已编码的可迁移表示是需要保留的关键方面。因此,我们提出了多模态流剪枝(Multimodal Flow Pruning, MULTIFLOW),这是首个用于 TA-VLP 的无梯度剪枝框架,其中: 参数的重要性通过其幅度及其信息流来表示,并结合了其所连接神经元的显著性; 剪枝由 VLM 参数在预训练后涌现的(多模态)分布所驱动。我们在 TA-VLP 背景下对八种 state-of-the-art 剪枝算法进行了基准测试,在两种 VLM、三个视觉-语言任务和三个剪枝比例下进行了实验。我们的实验结果表明,MULTIFLOW 在绝大多数情况下优于近期复杂的组合竞争方法,为解决 TA-VLP 铺平了道路。代码公开于 https://github.com/FarinaMatteo/multiflow。

关键词

引用

@article{arxiv.2404.05621,
  title  = {MULTIFLOW: Shifting Towards Task-Agnostic Vision-Language Pruning},
  author = {Matteo Farina and Massimiliano Mancini and Elia Cunegatti and Gaowen Liu and Giovanni Iacca and Elisa Ricci},
  journal= {arXiv preprint arXiv:2404.05621},
  year   = {2024}
}

备注

CVPR 2024