中文

基于黑盒概率认证的解释信任域

机器学习 2024-06-06 v3 人工智能

摘要

鉴于机器学习模型的黑盒性质,目前已开发出大量可解释性方法来解读个体决策背后的因素。本文引入了一个新的黑盒(概率)解释认证问题。我们提出如下问题:给定一个仅有查询访问权限的黑盒模型、一个针对某样本的解释以及一个质量指标(即保真度、稳定性),我们能否找到以该样本为中心的最大超立方体(即 \ell_{\infty} 球),使得当该解释应用于超立方体内的所有样本时,(以高概率)满足质量标准(即保真度大于某个值)?能够高效找到这样一个“信任域”具有多重益处:i) 洞察模型在某个“区域”内的行为,并带有“保证”;ii) 确认解释的“稳定性”;iii) “解释重用”,无需为每个样本寻找解释,从而节省时间、能源和资金;iv) 一种用于比较解释方法的可能的“元指标”。我们的贡献包括将该问题形式化、提出解决方案、为这些解决方案提供可计算的理论保证,并在合成数据和真实数据上实验验证了其有效性。

关键词

引用

@article{arxiv.2402.11168,
  title  = {Trust Regions for Explanations via Black-Box Probabilistic Certification},
  author = {Amit Dhurandhar and Swagatam Haldar and Dennis Wei and Karthikeyan Natesan Ramamurthy},
  journal= {arXiv preprint arXiv:2402.11168},
  year   = {2024}
}

备注

Accepted to ICML 2024