中文

神经网络的因果抽象

人工智能 2021-10-28 v2 机器学习

摘要

结构分析方法(例如探针探测和特征归因)是日益重要的神经网络分析工具。我们提出了一种基于形式化因果抽象理论的新结构分析方法,该理论可对模型内部表征及其在输入/输出行为中的作用提供丰富刻画。在该方法中,神经表征与可解释因果模型中的变量相对齐,随后使用互换干预来实验验证神经表征具有其对齐变量的因果性质。我们在一个案例研究中应用该方法,分析在 Multiply Quantified Natural Language Inference (MQNLI) 语料库上训练的神经网络模型,该语料库是一个极具复杂性的 NLI 数据集,由树状结构的自然语言逻辑因果模型构建而成。我们发现,一个具有最先进性能的基于 BERT 的模型成功实现了自然语言逻辑模型因果结构的部分内容,而一个更简单的基线模型未能展现出任何此类结构,这表明 BERT 表征编码了 MQNLI 的组合结构。

关键词

引用

@article{arxiv.2106.02997,
  title  = {Causal Abstractions of Neural Networks},
  author = {Atticus Geiger and Hanson Lu and Thomas Icard and Christopher Potts},
  journal= {arXiv preprint arXiv:2106.02997},
  year   = {2021}
}

备注

NeurIPS 2021