中文

具有概率保证的神经网络鲁棒反事实解释

机器学习 2024-03-19 v3 人工智能 计算机与社会 信息论 机器学习 math.IT

摘要

学界正日益关注生成鲁棒反事实解释,使其在模型即便被轻微更新或改变时仍保持有效。为寻找鲁棒反事实,现有文献常假设原模型mm与新模型MM在参数空间中有界,即Params(M)Params(m)<Δ\|\text{Params}(M){-}\text{Params}(m)\|{<}\Delta。然而,模型在参数空间上常可发生显著变化,而在给定数据集上的预测或准确率却几乎不变。本工作中,我们引入称为自然发生\textit{自然发生}模型变化的数学抽象,其允许参数空间中的任意变化,只要位于数据流形上的点的预测变化受限。接着,我们提出一种度量——称为稳定性\textit{稳定性}——用以量化可微模型(如神经网络)反事实对潜在模型变化的鲁棒性。我们的主要贡献是证明:由我们的度量所定义的具有足够高稳定性\textit{稳定性}值的反事实,在潜在自然发生\textit{自然发生}模型变化后以高概率保持有效(利用独立高斯变量的Lipschitz函数集中界)。由于我们的量化依赖于数据点周围的局部Lipschitz常数(并非总可获得),我们也考察了所提度量的实用松弛,并通过实验展示如何将其纳入以寻找既接近、真实、又在潜在模型变化后保持有效的神经网络鲁棒反事实。本工作还与模型多样性(亦称Rashomon效应)存在有趣联系。

关键词

引用

@article{arxiv.2305.11997,
  title  = {Robust Counterfactual Explanations for Neural Networks With Probabilistic Guarantees},
  author = {Faisal Hamman and Erfaun Noorani and Saumitra Mishra and Daniele Magazzeni and Sanghamitra Dutta},
  journal= {arXiv preprint arXiv:2305.11997},
  year   = {2024}
}

备注

International Conference on Machine Learning (ICML), 2023