中文

面向XAI的以实例为中心反事实算法基准评测:从白盒到黑盒

机器学习 2024-11-11 v4 人工智能

摘要

本研究通过对三类不同模型——决策树(完全透明、可解释的白盒模型)、随机森林(半可解释的灰盒模型)和神经网络(完全不透明的黑盒模型)——进行基准评测,考察机器学习模型对反事实解释生成的影响。我们在25个不同数据集上使用文献中的四种算法(DiCE、WatcherCF、prototype和GrowingSpheresCF)测试了反事实生成过程。我们的发现表明:(1)不同的机器学习模型对反事实解释的生成影响甚微;(2)仅基于邻近性损失函数的反事实算法不可操作,无法提供有意义的解释;(3)若不保证反事实生成中的合理性,就无法得到有意义的评测结果。若以当前最先进指标评测,内部机制未考虑合理性的算法将导致有偏且不可靠的结论;(4)强烈建议进行反事实审查分析,以确保对反事实解释的稳健检验及潜在偏见的识别。

关键词

引用

@article{arxiv.2203.02399,
  title  = {Benchmarking Instance-Centric Counterfactual Algorithms for XAI: From White Box to Black Box},
  author = {Catarina Moreira and Yu-Liang Chou and Chihcheng Hsieh and Chun Ouyang and João Madeiras Pereira and Joaquim Jorge},
  journal= {arXiv preprint arXiv:2203.02399},
  year   = {2024}
}