具有概率保证的神经网络鲁棒反事实解释
机器学习
2024-03-19 v3 人工智能
计算机与社会
信息论
机器学习
math.IT
摘要
学界正日益关注生成鲁棒反事实解释,使其在模型即便被轻微更新或改变时仍保持有效。为寻找鲁棒反事实,现有文献常假设原模型与新模型在参数空间中有界,即。然而,模型在参数空间上常可发生显著变化,而在给定数据集上的预测或准确率却几乎不变。本工作中,我们引入称为模型变化的数学抽象,其允许参数空间中的任意变化,只要位于数据流形上的点的预测变化受限。接着,我们提出一种度量——称为——用以量化可微模型(如神经网络)反事实对潜在模型变化的鲁棒性。我们的主要贡献是证明:由我们的度量所定义的具有足够高值的反事实,在潜在模型变化后以高概率保持有效(利用独立高斯变量的Lipschitz函数集中界)。由于我们的量化依赖于数据点周围的局部Lipschitz常数(并非总可获得),我们也考察了所提度量的实用松弛,并通过实验展示如何将其纳入以寻找既接近、真实、又在潜在模型变化后保持有效的神经网络鲁棒反事实。本工作还与模型多样性(亦称Rashomon效应)存在有趣联系。
关键词
引用
@article{arxiv.2305.11997,
title = {Robust Counterfactual Explanations for Neural Networks With Probabilistic Guarantees},
author = {Faisal Hamman and Erfaun Noorani and Saumitra Mishra and Daniele Magazzeni and Sanghamitra Dutta},
journal= {arXiv preprint arXiv:2305.11997},
year = {2024}
}
备注
International Conference on Machine Learning (ICML), 2023