中文

变换器电路的机械解释:自影响力是模型推理的关键

人工智能 2025-02-17 v2

摘要

变换器-based 语言模型取得了显著的成功,但由于非线性相互作用和高维运算的复杂性,这些模型的内部机制仍然鲜为人知。虽然之前的研究表明,这些模型隐式地嵌入了推理树,但人类通常会使用各种不同的逻辑推理机制来完成相同的任务。仍不清楚语言模型用于解决此类任务的哪些多步骤推理机制。本文旨在通过调查语言模型的机械可解释性,特别是在多步骤推理任务的背景下,来回答此问题。具体而言,我们采用电路分析和自影响函数来评估每个 token 在推理过程中重要性的变化,从而映射模型所采用的推理路径。我们将此方法应用于 GPT-2 模型的预测任务(IOI),并展示所发现的电路揭示了模型所使用的可人类解释的推理过程。

关键词

引用

@article{arxiv.2502.09022,
  title  = {Mechanistic Unveiling of Transformer Circuits: Self-Influence as a Key to Model Reasoning},
  author = {Lin Zhang and Lijie Hu and Di Wang},
  journal= {arXiv preprint arXiv:2502.09022},
  year   = {2025}
}

备注

Accepted by NAACL2025