中文

LIPEx——局部可解释概率解释:超越真实类别的视角

机器学习 2023-12-08 v2

摘要

在这项工作中,我们实例化了一个新颖的基于扰动的多类解释框架 LIPEx(局部可解释概率解释,Locally Interpretable Probabilistic Explanation)。我们证明 LIPEx 不仅在局部复现了广泛使用的复杂分类模型输出的概率分布,还提供了关于每个被认为重要的特征如何影响每个可能类别的预测概率的洞见。我们通过将解释定义为在概率分布空间中相对于 Hellinger 距离通过回归获得的矩阵来实现这一点。在文本和图像数据上的消融测试表明,与基于其他显著性或其他基于特征重要性的可解释 AI(XAI)方法进行的类似测试相比,LIPEx 引导的从数据中移除重要特征会导致底层模型的预测发生更多变化。研究还表明,与 LIME 相比,LIPEx 在使用更少的数据扰动次数以获得可靠解释方面更具数据效率。这种数据效率体现为,在文本数据的分类实验中,LIPEx 计算其解释矩阵的速度比全类 LIME 快约 53%。

关键词

引用

@article{arxiv.2310.04856,
  title  = {LIPEx-Locally Interpretable Probabilistic Explanations-To Look Beyond The True Class},
  author = {Hongbo Zhu and Angelo Cangelosi and Procheta Sen and Anirbit Mukherjee},
  journal= {arXiv preprint arXiv:2310.04856},
  year   = {2023}
}

备注

19 pages, 9 figures