OPTIMA:通过二次规划重建实现 LLM 的最优单次剪枝
机器学习
2026-01-01 v2 人工智能
性能
摘要
训练后模型剪枝是一种有前景的解决方案,但它面临一个权衡:简单启发式方法将权重置零速度快但会降低精度,而原则性的联合优化方法能恢复精度但在现代规模下计算不可行。SparseGPT 等单次方法通过应用高效、近似的启发式权重更新,在最优性方面提供了实用的权衡。为了缩小这一差距,我们提出 OPTIMA,一种平衡精度和可扩展性的实用单次训练后剪枝方法。OPTIMA 将掩码选择后的逐层权重重建表述为独立的逐行二次规划(QP),它们共享一个共同的层 Hessian。求解这些 QP 可得到相对于重建目标在给定估计 Hessian 下的逐行全局最优更新。共享 Hessian 结构使该问题非常适合在加速器上进行批处理。我们实现了一个加速器友好的 QP 求解器,每层累积一个 Hessian 并并行求解许多小型 QP,从而在单个加速器上实现大规模单次训练后剪枝,无需微调。OPTIMA 与现有掩码选择器集成,并在多个 LLM 家族和稀疏度设置中一致地提升了零样本性能,最高获得 3.97% 的绝对精度提升。在 NVIDIA H100 上,OPTIMA 在 40 小时内以 60GB 峰值内存完成了一个 8B 参数 transformer 的端到端剪枝。这些结果共同为单次训练后剪枝设立了新的精度-效率权衡最先进水平。
引用
@article{arxiv.2512.13886,
title = {OPTIMA: Optimal One-shot Pruning for LLMs via Quadratic Programming Reconstruction},
author = {Mohammad Mozaffari and Samuel Kushnir and Maryam Mehri Dehnavi and Amir Yazdanbakhsh},
journal= {arXiv preprint arXiv:2512.13886},
year = {2026}
}