中文

通过更智能的局部采样提升LIME鲁棒性

机器学习 2021-03-23 v3 机器学习

摘要

诸如LIME之类的可解释性算法使机器学习系统具备了透明性与公平性,这些是在商业用例中的重要特质。然而,近期工作表明LIME的朴素采样策略可被对手利用以掩盖有偏的、有害的行为。我们提议通过训练一个生成对抗网络来采样更真实的合成数据,解释器使用这些合成数据生成解释,从而使LIME更鲁棒。我们的实验表明,与原始LIME相比,我们所提方法在三个真实世界数据集上检测有偏对抗行为的准确率有所提升。这是在保持可比较解释质量的同时实现的,在某些情况下top-1准确率高达99.94%。

关键词

引用

@article{arxiv.2006.12302,
  title  = {Improving LIME Robustness with Smarter Locality Sampling},
  author = {Sean Saito and Eugene Chua and Nicholas Capel and Rocco Hu},
  journal= {arXiv preprint arXiv:2006.12302},
  year   = {2021}
}

备注

AdvML '20: Workshop on Adversarial Learning Methods for Machine Learning and Data Mining, August 24, 2020, San Diego, CA. 5 pages, 2 figures