POP:面向大型基础模型的在线结构剪枝以实现高效推理
人工智能
2026-02-09 v1
摘要
大型基础模型(LFMs)通过规模化实现卓越性能,但当前结构剪枝方法在推理期间会生成固定的剪枝决策,忽略自回归 token 生成中出现的稀疏性模式。本文提出 POP(Partition-guided Online Pruning),一种高效的在线结构剪枝框架,支持具有最小计算开销的上下文条件动态剪枝。POP 将模型通道划分为保留、候选和剪枝区域,其中预填充定义粗粒度剪枝划分,解码阶段在候选区域内生成细粒度掩码,避免完整通道重新评估。粗粒度剪枝划分保留持续重要的权重,而细粒度掩码在解码过程中提供上下文条件的变化。此外,POP 是一种轻量级、即插即用的方法,无需预处理,包括离线校准、重新训练或学习预测器。广泛的评估涵盖各种 LFMs,包括大型语言模型(LLMs)、混合专家模型(MoEs)和视觉语言模型(VLMs),表明 POP 在保持更高准确率方面优于现有剪枝方法,同时计算开销更小,推理延迟更低。
引用
@article{arxiv.2602.06822,
title = {POP: Online Structural Pruning Enables Efficient Inference of Large Foundation Models},
author = {Yi Chen and Wonjin Shin and Shuhong Liu and Tho Mai and Jeongmo Lee and Chuanbo Hua and Kun Wang and Jun Liu and Joo-Young Kim},
journal= {arXiv preprint arXiv:2602.06822},
year = {2026}
}