中文

从电路证据到机制理论:一种归纳逻辑方法

机器学习 2026-05-21 v1 人工智能 计算机科学中的逻辑

摘要

机制可解释性产生了神经网络行为的电路水平因果分析,但发现的电路往往仍是孤立的实验制品:没有共享的形式表示来描述电路计算的内容、它们之间的关系,或两个发现是否为同一机制提供证据。本工作通过将电路解释视为归纳理论构建,为可累积的机制科学提供形式化基础。每个电路在两个层面上进行特征化:Causal Functional Signature (CFS),将组件行为 grounded 在因果归因证据和 token 角色轮廓上;以及由归纳逻辑程序 (ILP) 从尺度不变结构谓词学习的建筑签名 τarch\tau_{\mathrm{arch}}。这些构成一个使机制论点显式、通过 θ\theta-吞噬进行比较,并跨模型规模可移植的形式一致性层。CFS 揭示了不同任务类型中 qualitatively 不同的计算策略,包括注意力介导的复制 versus MLP 介导的绑定。ILP 签名在结构分离方面优于图核和特征向量基线,并支持跨模型规模和建筑族系的原则性迁移。

关键词

引用

@article{arxiv.2605.21303,
  title  = {From Circuit Evidence to Mechanistic Theory: An Inductive Logic Approach},
  author = {Nura Aljaafari and Danilo S. Carvalho and Andre Freitas},
  journal= {arXiv preprint arXiv:2605.21303},
  year   = {2026}
}

备注

27 pages, 10 Figures, 14 Tables