中文

COUNTDOWN:基于下投影矩阵稀疏性的激活过滤不必要权重

机器学习 2025-10-28 v3 人工智能 计算与语言

摘要

大型语言模型的规模不断增大,造成了显著的计算效率低下。为解决这一挑战,稀疏激活方法在推理时选择性地停用非本质参数,降低 FFNN 层的计算成本。虽然现有方法关注非线性门控机制,但我们假设 FFNN 层的稀疏性在全局形式上体现为其内部下投影矩阵上的线性组合。基于这一洞见,我们提出了两种方法:M-COUNTDOWN 利用间接系数,D-COUNTDOWN 利用线性组合的直接系数。实验结果表明,D-COUNTDOWN 可消除 90% 的计算,性能损失仅为 5.5%,而 M-COUNTDOWN 提供一种无预测器的解决方案,性能保留率最高可比现有方法高出 29.4%。我们的专用内核实现有效地将这些理论收益转化为显著的实际加速。

关键词

引用

@article{arxiv.2505.17701,
  title  = {COUNTDOWN: Contextually Sparse Activation Filtering Out Unnecessary Weights in Down Projection},
  author = {Jaewon Cheon and Pilsung Kang},
  journal= {arXiv preprint arXiv:2505.17701},
  year   = {2025}
}

备注

EMNLP 2025 (Main Track)