中文

可靠的事后解释:在可解释性中建模不确定性

机器学习 2021-11-09 v4 机器学习

摘要

随着黑盒解释日益被用于在高风险场景中建立模型可信度,确保这些解释准确且可靠十分重要。然而,先前工作表明,最先进技术生成的解释不一致、不稳定,且极少揭示其正确性与可靠性。此外,这些方法计算效率低,且需要大量超参数调优。在本文中,我们通过开发一种新颖的贝叶斯框架来生成局部解释及其关联不确定性,从而应对上述挑战。我们实例化该框架以获得LIME和KernelSHAP的贝叶斯版本,其输出特征重要性的可信区间,捕获关联的不确定性。所得解释不仅使我们能对质量做出具体推断(例如,特征重要性落在给定范围内的概率为95%),而且高度一致和稳定。我们进行了详细的理论分析,利用上述不确定性估计应采样多少扰动以及如何采样以实现更快收敛。该工作首次尝试一次性解决流行解释方法的若干关键问题,从而以计算高效的方式生成具有保证的一致、稳定且可靠的解释。基于多个真实世界数据集和用户研究的实验评估证明了所提框架的有效性。

关键词

引用

@article{arxiv.2008.05030,
  title  = {Reliable Post hoc Explanations: Modeling Uncertainty in Explainability},
  author = {Dylan Slack and Sophie Hilgard and Sameer Singh and Himabindu Lakkaraju},
  journal= {arXiv preprint arXiv:2008.05030},
  year   = {2021}
}