中文

大语言模型中记忆与泛化的神经元级区分

计算与语言 2025-07-10 v2

摘要

我们研究了大型语言模型(LLM)如何在神经元层面区分记忆与泛化。通过设计严密的任务,我们识别出负责各类行为的不同神经元子集。实验在从头训练的 GPT-2 模型和使用 LoRA 微调的预训练 LLaMA-3.2 模型上均显示出一致的神经元级专业化。我们进一步证明,对这些神经元进行推理时的干预可引导模型的行为朝向记忆或泛化。为评估鲁棒性,我们评估了任务内一致性和任务间一致性,确认这些神经元-行为关联反映的是可泛化模式,而非数据集特定的制品。我们的发现揭示了 LLM 的模块化结构,并实现了在推理时控制记忆和泛化行为的能力。

关键词

引用

@article{arxiv.2412.18497,
  title  = {Neuron-Level Differentiation of Memorization and Generalization in Large Language Models},
  author = {Ko-Wei Huang and Yi-Fu Fu and Ching-Yu Tsai and Yu-Chieh Tu and Tzu-Ling Cheng and Cheng-Yu Lin and Yi-Ting Yang and Heng-Yi Liu and Keng-Te Liao and Da-Cheng Juan and Shou-De Lin},
  journal= {arXiv preprint arXiv:2412.18497},
  year   = {2025}
}