中文

GLASS:用于大型语言模型推理时稀疏化的全局-局部聚合方法

机器学习 2026-05-14 v2 人工智能 计算与语言

摘要

推理时稀疏化是在资源受限设备上部署大型语言模型(LLMs)的一条有前景的路径,然而现有的免训练方法通常仅从输入提示词本身估计前馈网络(FFN)神经元的重要性。我们证明这种仅依赖提示词的信号往往不可靠,尤其是在短提示词和长文本解码场景下,会导致不准确的掩码和生成保真度下降。我们提出了 GLASS,一个即插即用、免训练的框架,通过聚合神经元关键性的两个互补视角来稳定动态 FFN 剪枝:局部的提示特定激活和全局的模型固有先验。GLASS 通过秩聚合融合全局和局部信号,即使在提示词很短的情况下也能产生鲁棒的关键神经元选择。我们将 GLASS 解释为基于排列的概率模型下的最大后验共识排序,为其加权秩聚合规则提供了原则性基础。我们将 GLASS 应用于多种开源 LLMs,并证明在具有挑战性的短提示词、长生成场景中,它相较于先前的免训练基线方法有显著改进,实现了高达 45.10% 的困惑度降低和 25.73% 的 KL 散度降低,同时显著提升了设备端解码速度。

关键词

引用

@article{arxiv.2508.14302,
  title  = {GLASS: Global-Local Aggregation for Inference-time Sparsification of LLMs},
  author = {Amirmohsen Sattarifard and Sepehr Lavasani and Kunlin Zhang and Amirhossein Rajabpour and Hanlin Xu and Fengyu Sun and Negar Hassanpour and Chao Gao},
  journal= {arXiv preprint arXiv:2508.14302},
  year   = {2026}
}