中文

通过神经机制稀疏化高效发现近因抽象

机器学习 2026-03-02 v1 人工智能

摘要

神经网络被假设实现可解释的因果机制,但验证这一假设需要找到一种简洁且对干预下仍忠实于网络的高层结构因果模型(SCM)。发现此类抽象通常困难:它通常需要暴力遍历性干预或重新训练。我们通过将结构化剪枝视为在近似抽象上的搜索来重新构建此问题。将训练好的网络视为确定性 SCM,我们推导了干预风险目标,其二阶展开结果产生闭式准则,用于替换单元为常数或折叠到相邻单元。在均匀曲率假设下,我们的评分简化为激活方差,从而恢复了基于方差的剪枝作为一种特殊情况,并阐明了其何时失败的条件。最终的程序高效地从预训练网络中提取稀疏且对干预忠实的抽象,并通过交替干预进行验证。

关键词

引用

@article{arxiv.2602.24266,
  title  = {Efficient Discovery of Approximate Causal Abstractions via Neural Mechanism Sparsification},
  author = {Amir Asiaee},
  journal= {arXiv preprint arXiv:2602.24266},
  year   = {2026}
}