中文

局部解释的保证区域

机器学习 2024-02-21 v1

摘要

利用局部代理模型(例如 LIME)的可解释性方法非常擅长描述预测模型在兴趣点处的行为,但不能保证外推到该点周围的局部区域。然而,对预测模型局部曲率的过拟合以及恶意篡改会显著限制外推能力。我们提出了一种基于锚点(anchor-based)的算法,用于识别局部解释被保证正确的区域,方法是明确描述输入特征可信赖的区间。我们的方法生成了一个可解释的特征对齐框,在其中局部代理模型的预测被保证与预测模型相匹配。我们证明,与现有基线相比,我们的算法可用于找到具有更大保证区域的解释,从而更好地覆盖数据流形。我们还展示了我们的方法如何识别具有显著较差保证区域的误导性局部解释。

关键词

引用

@article{arxiv.2402.12737,
  title  = {Guarantee Regions for Local Explanations},
  author = {Marton Havasi and Sonali Parbhoo and Finale Doshi-Velez},
  journal= {arXiv preprint arXiv:2402.12737},
  year   = {2024}
}