从电路证据到机制理论:一种归纳逻辑方法
机器学习
2026-05-21 v1 人工智能
计算机科学中的逻辑
摘要
机制可解释性产生了神经网络行为的电路水平因果分析,但发现的电路往往仍是孤立的实验制品:没有共享的形式表示来描述电路计算的内容、它们之间的关系,或两个发现是否为同一机制提供证据。本工作通过将电路解释视为归纳理论构建,为可累积的机制科学提供形式化基础。每个电路在两个层面上进行特征化:Causal Functional Signature (CFS),将组件行为 grounded 在因果归因证据和 token 角色轮廓上;以及由归纳逻辑程序 (ILP) 从尺度不变结构谓词学习的建筑签名 。这些构成一个使机制论点显式、通过 -吞噬进行比较,并跨模型规模可移植的形式一致性层。CFS 揭示了不同任务类型中 qualitatively 不同的计算策略,包括注意力介导的复制 versus MLP 介导的绑定。ILP 签名在结构分离方面优于图核和特征向量基线,并支持跨模型规模和建筑族系的原则性迁移。
引用
@article{arxiv.2605.21303,
title = {From Circuit Evidence to Mechanistic Theory: An Inductive Logic Approach},
author = {Nura Aljaafari and Danilo S. Carvalho and Andre Freitas},
journal= {arXiv preprint arXiv:2605.21303},
year = {2026}
}
备注
27 pages, 10 Figures, 14 Tables