选择明智且可解释:主动学习与概率局部后验可解释性
机器学习
2022-04-25 v2
摘要
尽管在数据密集型领域设计复杂人工智能(AI)系统方面取得了巨大性能提升,但这些系统的黑盒性质导致了可信赖性的缺失。后验可解释性方法解释黑盒ML模型对单个实例的预测,此类解释正被领域专家用来诊断这些模型的潜在偏差。尽管现有方法在提供有价值洞察方面有效,但其未能给出一致且可靠的解释。本文提出一种基于主动学习的技术UnRAvEL(不确定性驱动的鲁棒主动学习局部忠实解释),其包含一个新颖的获取函数,该函数局部忠实并利用基于高斯过程回归(GPR)的概率局部后验分布进行不确定性驱动采样。我们将UnRAvEL视为局部优化器并分析其相对于全局优化器的遗憾,从而给出理论分析。通过在GPR中引入Matern与线性等多种核,我们展示了UnRAvEL所生成局部样本的有效性。一系列实验表明,在多个真实模型与数据集上,UnRAvEL在稳定性与局部忠实性方面优于基线。我们利用稀疏线性模型在该代理数据集上推导重要性分数,表明UnRAvEL是一种高效的代理数据集生成器。我们还使用预训练ResNet模型在Imagenet数据集上展示了所开发框架的采样效率与灵活性。
引用
@article{arxiv.2108.06907,
title = {Select Wisely and Explain: Active Learning and Probabilistic Local Post-hoc Explainability},
author = {Aditya Saini and Ranjitha Prasad},
journal= {arXiv preprint arXiv:2108.06907},
year = {2022}
}
备注
To be published in the main track of AIES'22