面向任务级可控LLM的好神经元与坏神经元识别
计算与语言
2026-03-06 v2 人工智能
摘要
大型语言模型在多项选择问答基准上展现出了卓越的能力,但其大规模神经元背后的复杂机制仍不透明,这给理解和引导LLM带来了重大挑战。尽管最近的研究在识别特定能力对应的负责神经元方面取得了进展,但这些特定能力的方法对于需要协调使用多种能力的任务聚焦场景是不可行的。此外,这些方法仅关注与任务完成正相关的支持性神经元,而忽略了具有其他角色(如抑制性角色)的神经元,并且由于LLM中的偶然行为(即凭运气而非真正理解正确回答问题)而误导了神经元归因。为了应对这些挑战,我们提出了 NeuronLLM,这是一个新颖的任务级LLM理解框架,它采用功能拮抗的生物学原理来进行LLM神经元识别。其关键洞察在于,任务表现由具有两种对立角色的神经元共同决定:促进任务完成的好神经元和抑制任务完成的坏神经元。NeuronLLM 通过对好神经元和坏神经元的对比学习实现了对神经元的整体建模,同时利用增强的问题集来减轻LLM中的偶然行为。在不同规模和系列的LLM上的综合实验表明,NeuronLLM 在四个NLP任务上优于现有方法,为LLM的功能组织提供了新见解。
引用
@article{arxiv.2601.04548,
title = {Identifying Good and Bad Neurons for Task-Level Controllable LLMs},
author = {Wenjie Li and Guansong Pang and Hezhe Qiao and Debin Gao and David Lo},
journal= {arXiv preprint arXiv:2601.04548},
year = {2026}
}