通过知识编辑理解语言模型电路
计算与语言
2025-07-17 v4
摘要
近期语言模型可解释性进展已识别出电路——复制模型行为的关键子网络,但知识在这些关键子网络中的结构仍不清晰。为理解电路中的知识,本文对 GPT-2 语言模型电路进行系统性知识编辑实验。我们的分析揭示了电路对编辑尝试的反应模式、知识在网络组件中的分布程度以及知识承载电路的结构组成。这些发现为理解语言模型电路与知识表示之间的复杂关系提供了洞见,深化了对信息在语言模型内部组织方式的理解。我们的发现为电路的“含义”提供了新颖见解,并为进一步的可解释性和安全性研究指明了方向。
引用
@article{arxiv.2406.17241,
title = {Understanding Language Model Circuits through Knowledge Editing},
author = {Huaizhi Ge and Frank Rudzicz and Zining Zhu},
journal= {arXiv preprint arXiv:2406.17241},
year = {2025}
}
备注
A previous version of this document contained a hidden prompt entered by Z Zhu without knowledge of -- or consent by -- his co-authors. This version does not contain the prompt