Bayes-TrEx:一种基于贝叶斯采样的示例式模型透明化方法
机器学习
2020-12-17 v4 机器学习
摘要
事后解释方法在解释、理解和调试神经网络方面正日益流行。使用此类方法的大多数分析都是针对从测试集中抽取的输入来解释决策。然而,测试集可能仅有少量触发某些模型行为的样本,例如高置信度失败或模糊分类。为应对这些挑战,我们引入了一个灵活的模型检查框架:Bayes-TrEx。给定数据分布,Bayes-TrEx 可找到具有指定预测置信度的分布内样本。我们展示了 Bayes-TrEx 的若干用例,包括揭示高置信度(误)分类、通过模糊样本可视化类别边界、理解新类别外推行为,以及暴露神经网络过置信现象。我们使用 Bayes-TrEx 研究在 CLEVR、MNIST 和 Fashion-MNIST 上训练的分类器,并表明该框架相比仅检查测试集能够实现更灵活的整体性模型分析。代码见 https://github.com/serenabooth/Bayes-TrEx。
引用
@article{arxiv.2002.10248,
title = {Bayes-TrEx: a Bayesian Sampling Approach to Model Transparency by Example},
author = {Serena Booth and Yilun Zhou and Ankit Shah and Julie Shah},
journal= {arXiv preprint arXiv:2002.10248},
year = {2020}
}
备注
Accepted at AAAI 2021