中文

LOP:面向多模态大语言模型高效按需剪枝

计算机视觉与模式识别 2025-06-17 v1

摘要

结构化剪枝技术对于在边缘设备到云服务器等各种硬件平台上部署多模态大语言模型(MLLMs)至关重要。然而,当前剪枝方法通常通过迭代搜索过程来确定最优策略,导致按需适配MLLMs的计算开销巨大。为此,我们提出LOP(Learning Optimal Pruning),一个高效的神经网络剪枝框架,通过从目标剪枝约束中学习最优剪枝策略,无需基于耗时的搜索方法。LOP方法通过训练自回归神经网络,直接预测适用于目标剪枝约束的逐层剪枝策略,消除了耗时的迭代搜索。实验结果表明,LOP在多个任务上的表现均优于当前最先进的剪枝方法,同时实现了最高可达三个数量级的加速。

关键词

引用

@article{arxiv.2506.12826,
  title  = {LOP: Learning Optimal Pruning for Efficient On-Demand MLLMs Scaling},
  author = {Zhihan Zhang and Xiang Pan and Hongchen Wei and Zhenzhong Chen},
  journal= {arXiv preprint arXiv:2506.12826},
  year   = {2025}
}