中文

提供补救作用的基于归因的解释不可能具有鲁棒性

机器学习 2023-12-21 v3 机器学习

摘要

机器学习方法的不同用户因其目标不同需要不同的解释。为使机器学习对社会负责,一个重要目标是获得可操作的补救选项,使受影响的用户能通过对其输入 xx 做有限改动来改变机器学习系统决策 f(x)f(x)。我们对此形式化,给出补救敏感性的通用定义,其需用描述哪些决策改动与用户相关的效用函数实例化。该定义适用于局部归因方法,即对每个输入特征赋予重要性权重的方法。常有人认为此类局部归因应鲁棒,即被解释输入 xx 的微小改动不应引起特征权重的巨大变化。然而,我们严格证明:任何单一归因方法一般不可能同时具备补救敏感性与鲁棒性。由此可知,至少其中一项性质必存在反例。我们针对若干流行归因方法(包括 LIME、SHAP、积分梯度与 SmoothGrad)给出此类反例。我们的结果也涵盖反事实解释,其可视为描述 xx 扰动的归因。我们进一步讨论规避该不可能性结果的潜在途径,例如允许输出由含多个归因的集合构成,并给出特定连续函数类具备补救敏感性的充分条件。最后,针对用户仅能改变 xx 单个属性的受限情形,我们通过精确刻画不可能性所适用的函数 ff 强化了不可能性结果。

关键词

引用

@article{arxiv.2205.15834,
  title  = {Attribution-based Explanations that Provide Recourse Cannot be Robust},
  author = {Hidde Fokkema and Rianne de Heide and Tim van Erven},
  journal= {arXiv preprint arXiv:2205.15834},
  year   = {2023}
}

备注

32 pages, 6 figures