中文

从间接宾语识别到三段论:探索变换器电路中的二进制机制

计算与语言 2025-08-25 v1 机器学习

摘要

变换器基语言模型 (LMs) 能够执行广泛的任务,机制可解释性 (MI) 旨在逆向工程完成任务所需的组件以理解其行为。先前的 MI 研究聚焦于语言任务,如间接宾语识别 (IOI)。本文通过分析 GPT-2 小模型处理三段论提示的行为(例如:"Statement A is true. Statement B matches statement A. Statement B is"),这需要比 IOI 更复杂的逻辑推理。我们通过对不同难度的三段论任务进行分析,识别出多个电路机械解释 GPT-2 逻辑推理能力,并发现促进任务完成的二进制机制,包括通过负面头产生输入提示中不存在的否定标记的能力。我们的评估使用忠诚度指标表明,由五个注意力头组成的电路可实现超过 90% 的原始模型性能。通过将我们的发现与 IOI 分析相关,我们为注意力头和 MLP 在 LMs 中的角色提供了新的见解。这些见解有助于更广泛地理解模型推理能力,支持机械可解释性研究的未来发展。

关键词

引用

@article{arxiv.2508.16109,
  title  = {From Indirect Object Identification to Syllogisms: Exploring Binary Mechanisms in Transformer Circuits},
  author = {Karim Saraipour and Shichang Zhang},
  journal= {arXiv preprint arXiv:2508.16109},
  year   = {2025}
}