辅助指标助力野外解码技能神经元
计算与语言
2025-11-27 v1
摘要
大型语言模型(LLMs)在广泛任务中展现出惊人的能力,但其内部机制仍然大体不为人知。本文引入一种简单、轻量且广泛适用的方法,聚焦于隔离编码特定技能的神经元。构建于先前通过软提示训练在分类任务上识别“技能神经元”的方法,我们的方案将分析扩展到涉及多个技能的复杂场景。我们将神经元激活与辅助指标(如外部标签和模型自身置信度得分)相关,从而在无需手动标记聚合的情况下揭示可解释且任务特定的行为。我们在覆盖开放式文本生成和自然语言推理的任务上进行经验验证,证明了该方法能够检测驱动已知技能的神经元,同时也揭示了在BigBench上算术推理中先前未识别的捷径。
引用
@article{arxiv.2511.21610,
title = {Auxiliary Metrics Help Decoding Skill Neurons in the Wild},
author = {Yixiu Zhao and Xiaozhi Wang and Zijun Yao and Lei Hou and Juanzi Li},
journal= {arXiv preprint arXiv:2511.21610},
year = {2025}
}
备注
7 pages, 7 figures. Includes additional appendix