关于特征重要性与反事实解释的鲁棒性的综述
机器学习
2023-01-04 v2 人工智能
摘要
已有若干方法致力于解决理解 AI/ML 模型行为这一关键任务。其中 arguably 最流行的是聚焦于考察模型在单个实例上行为的局部解释。已提出多种用于局部分析的方法,但相对而言,理解这些解释是否鲁棒并准确反映底层模型行为的努力较少。本工作中,我们综述了那些分析两类局部解释(特征重要性与反事实解释)鲁棒性的工作,这两类解释在金融领域分析 AI/ML 模型中常被使用。该综述旨在统一现有的鲁棒性定义,引入一种分类法以区分不同鲁棒性方法,并讨论若干有趣结果。最后,综述给出了关于扩展当前鲁棒性分析方法以识别可靠可解释性方法的一些指引。
引用
@article{arxiv.2111.00358,
title = {A Survey on the Robustness of Feature Importance and Counterfactual Explanations},
author = {Saumitra Mishra and Sanghamitra Dutta and Jason Long and Daniele Magazzeni},
journal= {arXiv preprint arXiv:2111.00358},
year = {2023}
}
备注
4 pages plus references. Accepted at the workshop on Explainable AI in Finance (XAI-FIN21). Camera-ready version. V2: Added more references and expanded robust explanations for counterfactuals