预训练变换器中的知识电路
计算与语言
2025-01-06 v4 人工智能
计算机视觉与模式识别
信息检索
机器学习
摘要
现代大型语言模型的惊人能力源于其参数中编码的知识库,使其能够感知世界并进行推理。如何在这些模型中存储知识的内在工作方式长期以来一直是研究人员关注的焦点。到目前为止,大多数研究集中于这些模型中的单个组件,如多层感知器和注意力头。本文我们深入研究语言模型的计算图,发现哪些知识电路在表达特定知识方面起着关键作用。借助GPT2和TinyLLAMA进行实验,我们观察到某些信息头、关系头和多层感知器如何协同编码模型中的知识。此外,我们评估了当前知识编辑技术对这些知识电路的影响,提供了对这些编辑方法功能和限制的更深入见解。最后,我们利用知识电路分析和解释语言模型行为,如幻觉和按需学习。我们认为,知识电路有望推动我们对变换器的理解,并指导改进知识编辑的设计。代码和数据可在 https://github.com/zjunlp/KnowledgeCircuits 获取。
引用
@article{arxiv.2405.17969,
title = {Knowledge Circuits in Pretrained Transformers},
author = {Yunzhi Yao and Ningyu Zhang and Zekun Xi and Mengru Wang and Ziwen Xu and Shumin Deng and Huajun Chen},
journal= {arXiv preprint arXiv:2405.17969},
year = {2025}
}
备注
NeurIPS 2024, 26 pages