一种全面可靠的特征归因方法:双面移除与重建(DoRaR)
机器学习
2023-10-30 v1 人工智能
摘要
深度神经网络(DNN)及其他机器学习(ML)模型内部决策机制的有限透明性阻碍了它们在多个领域的应用。为解决此问题,特征归因方法被开发出来以识别对这些黑盒模型决策有重大影响的关健特征。然而,许多特征归因方法存在固有缺陷。例如,一类特征归因方法受伪影问题困扰,其将分布外掩码输入直接送入原本在自然数据点上训练的分类器。另一类特征归因方法通过使用联合训练的特征选择器和预测器来寻找解释,虽避免了伪影问题,却受解释中编码预测(EPITE)问题影响,即预测器的决策不依赖于特征,而依赖于选择这些特征的掩码。因此,这些缺陷损害了归因结果的可信度。在本研究中,我们基于若干改进方法引入了双面移除与重建(DoRaR)特征归因方法,以解决上述问题。通过在MNIST、CIFAR10及我们自建的合成数据集上的充分测试,我们证明DoRaR特征归因方法能有效规避上述问题,并有助于训练出优于其他最先进特征归因方法的特征选择器。我们的代码见 https://github.com/dxq21/DoRaR。
引用
@article{arxiv.2310.17945,
title = {A Comprehensive and Reliable Feature Attribution Method: Double-sided Remove and Reconstruct (DoRaR)},
author = {Dong Qin and George Amariucai and Daji Qiao and Yong Guan and Shen Fu},
journal= {arXiv preprint arXiv:2310.17945},
year = {2023}
}
备注
16 pages, 22 figures