通过层级注意力与激活分析解构 Transformer 模型中的记忆与推理
机器学习
2026-03-16 v2 人工智能
摘要
Transformer-based 语言模型在记忆(检索已记忆事实)和推理(执行多步骤推理)方面都表现出色,但这些能力是否依赖于独立的内部机制仍不清楚。区分记忆与推理对于预测模型泛化、设计针对性评估以及构建只影响一种能力而不扰乱另一种能力的更安全干预措施至关重要。我们通过机制可解释性方法,使用合成语言谜题数据集对 Transformer 模型在层级、注意力头和神经元水平进行探针。我们的管道组合了激活修补和结构化消融,以因果方式衡量各组件对每种任务类型的贡献。在两个模型家族(Qwen 和 LLaMA)上,我们发现对不同层级和注意力头的干预导致选择性损害:禁用被识别的“记忆电路”可使事实检索准确率下降最高可达 15%,而推理能力保持不变;相反,禁用“推理电路”可使多步骤推理准确率下降相当程度。在神经元层面,我们观察到任务特定的放电模式,但这些效应不够稳健,这与神经元的多义性相符。我们的结果提供了记忆和推理依赖于可分离但相互交互的电路的首个因果证据。这些发现推动了机制可解释性,通过将电路级结构与功能专化联系起来,并表明受控数据集和因果干预如何为理解模型认知提供机制性见解,从而为大型语言模型的更安全部署提供指导。
引用
@article{arxiv.2510.03366,
title = {Disentangling Recall and Reasoning in Transformer Models through Layer-wise Attention and Activation Analysis},
author = {Harshwardhan Fartale and Ashish Kattamuri and Rahul Raja and Arpita Vats and Ishita Prasad and Akshata Kishore Moharir},
journal= {arXiv preprint arXiv:2510.03366},
year = {2026}
}