大语言模型中记忆与泛化的神经元级区分
计算与语言
2025-07-10 v2
摘要
我们研究了大型语言模型(LLM)如何在神经元层面区分记忆与泛化。通过设计严密的任务,我们识别出负责各类行为的不同神经元子集。实验在从头训练的 GPT-2 模型和使用 LoRA 微调的预训练 LLaMA-3.2 模型上均显示出一致的神经元级专业化。我们进一步证明,对这些神经元进行推理时的干预可引导模型的行为朝向记忆或泛化。为评估鲁棒性,我们评估了任务内一致性和任务间一致性,确认这些神经元-行为关联反映的是可泛化模式,而非数据集特定的制品。我们的发现揭示了 LLM 的模块化结构,并实现了在推理时控制记忆和泛化行为的能力。
引用
@article{arxiv.2412.18497,
title = {Neuron-Level Differentiation of Memorization and Generalization in Large Language Models},
author = {Ko-Wei Huang and Yi-Fu Fu and Ching-Yu Tsai and Yu-Chieh Tu and Tzu-Ling Cheng and Cheng-Yu Lin and Yi-Ting Yang and Heng-Yi Liu and Keng-Te Liao and Da-Cheng Juan and Shou-De Lin},
journal= {arXiv preprint arXiv:2412.18497},
year = {2025}
}