变换器电路的机械解释:自影响力是模型推理的关键
人工智能
2025-02-17 v2
摘要
变换器-based 语言模型取得了显著的成功,但由于非线性相互作用和高维运算的复杂性,这些模型的内部机制仍然鲜为人知。虽然之前的研究表明,这些模型隐式地嵌入了推理树,但人类通常会使用各种不同的逻辑推理机制来完成相同的任务。仍不清楚语言模型用于解决此类任务的哪些多步骤推理机制。本文旨在通过调查语言模型的机械可解释性,特别是在多步骤推理任务的背景下,来回答此问题。具体而言,我们采用电路分析和自影响函数来评估每个 token 在推理过程中重要性的变化,从而映射模型所采用的推理路径。我们将此方法应用于 GPT-2 模型的预测任务(IOI),并展示所发现的电路揭示了模型所使用的可人类解释的推理过程。
引用
@article{arxiv.2502.09022,
title = {Mechanistic Unveiling of Transformer Circuits: Self-Influence as a Key to Model Reasoning},
author = {Lin Zhang and Lijie Hu and Di Wang},
journal= {arXiv preprint arXiv:2502.09022},
year = {2025}
}
备注
Accepted by NAACL2025