中文

ABLE:使用对抗样本构建用于解释模型预测的局部模型

机器学习 2025-12-01 v1 人工智能

摘要

机器学习模型在关键应用中日益增多,但因缺乏透明度而多为“黑盒”。局部解释方法如 LIME 通过简单可解释模型逼近复杂模型在测试实例附近的行为,然而这些方法常存在不稳定性和较差的局部保真度问题。本文提出一种新方法,称为对抗性括号局部解释(ABLE),以解决上述局限性。我们的 approach 首先在测试实例附近生成一组邻域点,通过添加受限高斯噪声实现。对于每个邻域点 D,我们应用对抗攻击生成对抗点 A,使其产生最小扰动且标签与 D不同。随后对 A 再进行对抗攻击生成点 A',其标签与 D相同(因此与 A不同)。点 A 和 A' 形成对抗对,括号测试实例的局部决策边界。我们随后在这些对抗对上训练线性模型以逼近局部决策边界。在六个 UCI 基准数据集上测试三个深度神经网络架构,实验结果表明我们的方法在稳定性和保真度方面优于当前最先进的方法。

关键词

引用

@article{arxiv.2511.21952,
  title  = {ABLE: Using Adversarial Pairs to Construct Local Models for Explaining Model Predictions},
  author = {Krishna Khadka and Sunny Shree and Pujan Budhathoki and Yu Lei and Raghu Kacker and D. Richard Kuhn},
  journal= {arXiv preprint arXiv:2511.21952},
  year   = {2025}
}

备注

10 pages, 2 figures. Accepted to KDD 2026 (Research Track)