一种解释深度神经网络预测的对抗方法
机器学习
2020-09-29 v4 人工智能
机器学习
摘要
机器学习模型已成功应用于包括计算机视觉、自然语言处理与语音识别在内的广泛领域。然而,这些模型的成功实现通常依赖于深度神经网络(DNNs),因其难以理解的复杂性与错综的内部机制而被视为不透明的黑箱系统。在本工作中,我们提出一种利用对抗机器学习解释 DNN 预测的新颖算法。我们的方法基于对抗攻击在 DNN 上的行为,识别输入特征相对于预测的相对重要性。我们的算法具有快速、一致且易于实现与解释的优势。我们给出详细分析,证明给定 DNN 与任务时,对抗攻击的行为对任意输入测试数据点保持一致,从而证明我们方法的通用性。我们的分析使我们能够产生一致且高效的解释。我们通过使用多种 DNN、任务与数据集开展实验来说明我们方法的有效性。最后,我们将本工作与现有文献中其他知名技术进行比较。
引用
@article{arxiv.2005.10284,
title = {An Adversarial Approach for Explaining the Predictions of Deep Neural Networks},
author = {Arash Rahnama and Andrew Tseng},
journal= {arXiv preprint arXiv:2005.10284},
year = {2020}
}