检测并修剪大型语言模型中显著但有害的神经元
计算与语言
2025-07-15 v1 机器学习
摘要
大型语言模型(LLMs)常常会发展出针对特定数据集的专门机制,例如依赖于领域特定的相关性,这些机制会产生高置信度的预测,却缺乏可泛化的推理。虽然在某一情境下这些机制有益,但这些数据集特定的机制通常会在模型遇到新任务或新分布时导致性能下降。本文介绍一种微调方法,旨在通过识别与数据集特定机制相关的神经元并修剪它们来增强泛化能力。该方法采用积分梯度法(Integrated Gradients)来量化每个神经元对高置信度预测的影响,从而识别那些对数据集特定性能贡献突出、但不支持稳健、可迁移推理的神经元。对这些神经元进行选择性修剪可迫使模型依赖于通用表征。我们在多个选择题基准上评估了该修剪方法,结果表明该基于修剪的微调显著提升了性能,超越了之前的(非修剪)适应方法。
引用
@article{arxiv.2507.09185,
title = {Detecting and Pruning Prominent but Detrimental Neurons in Large Language Models},
author = {Ameen Ali and Shahar Katz and Lior Wolf and Ivan Titov},
journal= {arXiv preprint arXiv:2507.09185},
year = {2025}
}