中文

实现小型语言模型的稀疏激活

计算与语言 2024-06-12 v1 人工智能

摘要

稀疏激活通过在推理时选择性地激活仅与输入相关联的神经元集合,是一种在不进行重新训练或适应的情况下降低大型语言模型(LLM)计算成本的有用技术。然而,是否可以应用于最近涌现的小型语言模型(SLM)仍值得质疑,因为 SLM 通常不如 LLM 那样具有过参数化。在本文中,我们旨在实现 SLM 的稀疏激活。我们首先表明,现有 LLM 中的稀疏激活方案基于神经元输出幅度无法应用于 SLM,基于其归因分数激活神经元是更好的选择。进一步地,我们表明并量化了现有归因指标在用于稀疏激活时存在的大量误差,这是由于不同层神经元归因分数之间的相互依赖性所致。基于这些观察,我们提出了一种可证明纠正此类误差的新归因指标,并实现了精确的稀疏激活。实验在多个流行的 SLM 和数据集上表明,我们的方法可以在保持不超过 5% 模型准确率损失的同时实现 80% 的稀疏化比率,与 LLM 中实现的稀疏激活相当。源代码地址:https://github.com/pittisl/Sparse-Activation。

关键词

引用

@article{arxiv.2406.06562,
  title  = {Achieving Sparse Activation in Small Language Models},
  author = {Jifeng Song and Kai Huang and Xiangyu Yin and Boyuan Yang and Wei Gao},
  journal= {arXiv preprint arXiv:2406.06562},
  year   = {2024}
}

备注

15 pages