提供补救作用的基于归因的解释不可能具有鲁棒性
机器学习
2023-12-21 v3 机器学习
摘要
机器学习方法的不同用户因其目标不同需要不同的解释。为使机器学习对社会负责,一个重要目标是获得可操作的补救选项,使受影响的用户能通过对其输入 做有限改动来改变机器学习系统决策 。我们对此形式化,给出补救敏感性的通用定义,其需用描述哪些决策改动与用户相关的效用函数实例化。该定义适用于局部归因方法,即对每个输入特征赋予重要性权重的方法。常有人认为此类局部归因应鲁棒,即被解释输入 的微小改动不应引起特征权重的巨大变化。然而,我们严格证明:任何单一归因方法一般不可能同时具备补救敏感性与鲁棒性。由此可知,至少其中一项性质必存在反例。我们针对若干流行归因方法(包括 LIME、SHAP、积分梯度与 SmoothGrad)给出此类反例。我们的结果也涵盖反事实解释,其可视为描述 扰动的归因。我们进一步讨论规避该不可能性结果的潜在途径,例如允许输出由含多个归因的集合构成,并给出特定连续函数类具备补救敏感性的充分条件。最后,针对用户仅能改变 单个属性的受限情形,我们通过精确刻画不可能性所适用的函数 强化了不可能性结果。
引用
@article{arxiv.2205.15834,
title = {Attribution-based Explanations that Provide Recourse Cannot be Robust},
author = {Hidde Fokkema and Rianne de Heide and Tim van Erven},
journal= {arXiv preprint arXiv:2205.15834},
year = {2023}
}
备注
32 pages, 6 figures