中文

可操作的可解释性必须以对称性定义

人工智能 2026-01-30 v3 机器学习 神经与进化计算

摘要

本文论证人工智能 (AI) 领域的可解释性研究在根本上是不适定的,因为现有的可解释性定义未能描述如何对其进行形式化测试或设计。我们假设,可解释性的可操作定义必须以 *对称性* 来表述,这些对称性指导模型设计并导出可测试的条件。在概率视角下,我们假设四种对称性(推理等变性、信息不变性、概念闭包不变性和结构不变性)足以 (i) 将可解释模型形式化为概率模型的一个子类,(ii) 产生可解释推理(如对齐、干预和反事实)的统一表述作为一种 Bayesian 反演,以及 (iii) 提供一个形式化框架以验证是否符合安全标准与法规。

关键词

引用

@article{arxiv.2601.12913,
  title  = {Actionable Interpretability Must Be Defined in Terms of Symmetries},
  author = {Pietro Barbiero and Mateo Espinosa Zarlenga and Francesco Giannini and Alberto Termine and Filippo Bonchi and Mateja Jamnik and Giuseppe Marra},
  journal= {arXiv preprint arXiv:2601.12913},
  year   = {2026}
}