我该如何选择解释器?基于应用落地的后验解释评估
人工智能
2021-01-25 v2
摘要
已有若干研究工作提出新的可解释人工智能(XAI)方法,旨在生成具有特定属性或期望特性(如保真度、鲁棒性或人类可解释性)的模型解释。然而,解释极少基于其对决策任务真实实际影响进行评估。缺乏该评估,所选解释可能事实上损害 ML 模型与终端用户组合系统的整体性能。本研究旨在通过提出 XAI Test 来弥合这一差距,这是一种为隔离向终端用户提供不同信息层级的影响而定制的应用落地评估方法。我们依照 XAI Test 开展实验,在真实世界的欺诈检测任务上,使用真实数据、已部署的 ML 模型与欺诈分析师,评估三种流行的后验解释方法——LIME、SHAP 与 TreeInterpreter。实验中,我们分三个阶段逐步增加提供给欺诈分析师的信息:仅数据(即无模型分数与解释访问权限的交易数据)、数据 + ML 模型分数、数据 + ML 模型分数 + 解释。通过强统计分析,我们表明一般而言这些流行解释器的影响差于预期。部分结论要点包括:i) 仅数据在全部测试变体中决策精度最高且决策时间最长;ii) 所有解释器相较数据 + ML 模型分数变体提升了精度,但相比仅数据仍精度更低;iii) LIME 最不受用户青睐,可能因其个案间解释变异性显著更低。
引用
@article{arxiv.2101.08758,
title = {How can I choose an explainer? An Application-grounded Evaluation of Post-hoc Explanations},
author = {Sérgio Jesus and Catarina Belém and Vladimir Balayan and João Bento and Pedro Saleiro and Pedro Bizarro and João Gama},
journal= {arXiv preprint arXiv:2101.08758},
year = {2021}
}
备注
Accepted at FAccT'21, the ACM Conference on Fairness, Accountability, and Transparency