GPT模型中概念解释的机制:解释性见解
计算与语言
2024-08-23 v1
摘要
在大语言模型(LLM)中定位和编辑知识对于提高其准确性、安全性和推理逻辑至关重要。我们引入了“概念编辑”,这是一种知识编辑的创新变体,旨在揭示这些模型中的概念化机制。利用反向词典任务、推理追踪和输入抽象,我们分析了Transformer模型的多层感知机(MLP)、多头注意力(MHA)和隐藏状态组件。我们的结果揭示了不同的模式:MLP层采用键值检索机制和上下文相关处理,这与相对输入标记高度相关。MHA层表现出分布式特性,具有显著的高层激活,表明存在复杂的语义整合。隐藏状态强调了最后一个标记和顶层在推理过程中的重要性。我们观察到了信息逐步构建和分布式表示的证据。这些观察阐明了Transformer模型如何处理语义信息,为有针对性的干预和改进的可解释性技术铺平了道路。我们的工作突出了LLM中语义处理的复杂分层性质,以及在这些模型中隔离和修改特定概念的挑战。
引用
@article{arxiv.2408.11827,
title = {The Mechanics of Conceptual Interpretation in GPT Models: Interpretative Insights},
author = {Nura Aljaafari and Danilo S. Carvalho and André Freitas},
journal= {arXiv preprint arXiv:2408.11827},
year = {2024}
}
备注
23 pages, 25 figures