FAME:形式抽象最小解释
人工智能
2026-03-12 v1 机器学习
摘要
我们提出 FAME (Formal Abstract Minimal Explanations),这是一类基于抽象解释的归纳解释。FAME 是首个能够扩展至大型神经网络且减少 explanation 大小的方法。我们的主要贡献是设计专门的扰动域,以消除遍历顺序的需求。FAME 渐进式地缩小这些扰动域,并利用 LiRPA-based bounds 来丢弃不相关特征,最终收敛到形式抽象最小解释。为评估 explanation quality,我们引入一种度量抽象最小解释与真正最小解释之间最坏情况距离的程序。该程序结合对抗性攻击,外加可选的 VERIX+ 细化步骤。我们将 FAME 与 VERIX+ 进行基准测试,结果在中到大型神经网络上在 explanation 大小和运行时间上均实现一致的提升。
引用
@article{arxiv.2603.10661,
title = {FAME: Formal Abstract Minimal Explanation for Neural Networks},
author = {Ryma Boumazouza and Raya Elsaleh and Melanie Ducoffe and Shahaf Bassan and Guy Katz},
journal= {arXiv preprint arXiv:2603.10661},
year = {2026}
}