压缩多模态大语言模型的结构剪枝与恢复技术实证研究
计算与语言
2025-07-29 v1 计算机视觉与模式识别
摘要
尽管多模态大语言模型(MLLMs)展现了令人印象深刻的能力,但其巨大的计算和内存需求对实际部署构成了重大障碍。当前的参数缩减技术主要涉及从小型语言模型(SLMs)训练MLLMs,但这些方法灵活性有限且计算密集。为弥补这一不足,我们提出通过结构剪枝结合高效恢复训练来直接压缩现有MLLMs。具体而言,我们研究了两种结构剪枝范式——逐层剪枝和逐宽度剪枝——应用于MLLMs的语言模型主干,并结合了监督微调和知识蒸馏。此外,我们评估了仅使用一小部分可用数据进行恢复训练的可行性。我们的结果表明,在计算资源有限或微调数据不足的低资源场景下,逐宽度剪枝通常能保持更好的性能。关于恢复训练,在低压缩率(<20%)下,仅微调多模态投影器就足够了。此外,监督微调与隐藏状态蒸馏的结合在各种剪枝水平下都能产生最优的恢复效果。值得注意的是,仅使用原始训练数据的5%即可实现有效的恢复,同时保留超过95%的原始性能。通过对两个代表性MLLM(即LLaVA-v1.5-7B和Bunny-v1.0-3B)的实证研究,本研究为旨在无需大量计算资源或充足数据即可有效压缩MLLMs的实践者提供了可操作的见解。
引用
@article{arxiv.2507.20749,
title = {Investigating Structural Pruning and Recovery Techniques for Compressing Multimodal Large Language Models: An Empirical Study},
author = {Yiran Huang and Lukas Thede and Massimiliano Mancini and Wenjia Xu and Zeynep Akata},
journal= {arXiv preprint arXiv:2507.20749},
year = {2025}
}
备注
Accepted at GCPR 2025