MoPE-CLIP:基于模块化剪枝误差度量的高效视觉-语言模型结构化剪枝
计算机视觉与模式识别
2024-03-13 v1 人工智能
多媒体
摘要
视觉-语言预训练模型在各种下游任务上取得了令人印象深刻的性能。然而,它们庞大的模型尺寸阻碍了其在计算资源有限的平台上的应用。我们发现,直接使用较小的预训练模型并对CLIP模型应用基于幅度的剪枝会导致灵活性不足和性能较差。近期针对VLP压缩的努力要么采用单模态压缩度量导致性能有限,要么涉及带有可学习掩码的昂贵掩码搜索过程。在本文中,我们首先提出了模块化剪枝误差(MoPE)度量,通过跨模态任务上的性能下降来准确评估CLIP模块的重要性。利用MoPE度量,我们引入了一个统一的剪枝框架,适用于预训练和任务特定微调压缩阶段。对于预训练,MoPE-CLIP有效地利用了教师模型的知识,显著降低了预训练成本,同时保持了强大的零样本能力。对于微调,从宽度到深度的连续剪枝产生了极具竞争力的任务特定模型。两个阶段的大量实验证明了MoPE度量的有效性,并且MoPE-CLIP优于先前最先进的VLP压缩方法。
引用
@article{arxiv.2403.07839,
title = {MoPE-CLIP: Structured Pruning for Efficient Vision-Language Models with Module-wise Pruning Error Metric},
author = {Haokun Lin and Haoli Bai and Zhili Liu and Lu Hou and Muyi Sun and Linqi Song and Ying Wei and Zhenan Sun},
journal= {arXiv preprint arXiv:2403.07839},
year = {2024}
}
备注
18 pages, 8 figures, Published in CVPR2024