可信反事实:用真实对抗样本审计深度学习分类器
机器学习
2020-03-26 v1 密码学与安全
神经与进化计算
摘要
过去十年见证了深度学习模型在许多应用中的激增,取得了无可匹敌的预测性能水平。遗憾的是,深度学习模型的黑盒性质对其从数据中学习了什么提出了未解之谜。某些应用场景凸显了评估深度学习模型运行边界的重要性,该问题通过面向不同领域受众的各类方法得以解决。然而,随着应用焦点更多置于非专家用户,为其提供信任模型的手段成为必需,正如人类熟悉某一系统或过程:通过理解其失效的假设情境。这确实是本研究的基石:对深度学习模型开展对抗分析。所提框架通过确保反事实样本的可信性来构造之,例如,存在合理概率使人类无需借助计算机程序即可生成它们。因此,本工作应被视为对有界可用范围内某模型的有价值的审计实践,从而极大增进对真实应用中模型能力与缺陷的理解。为此,利用生成对抗网络(GAN)与多目标启发式方法对受审模型实施可信攻击,在该模型的混淆度、所生成反事实的强度与可信性之间高效权衡。其效用在人脸分类任务中得以展示,揭示了所提框架的巨大潜力。
引用
@article{arxiv.2003.11323,
title = {Plausible Counterfactuals: Auditing Deep Learning Classifiers with Realistic Adversarial Examples},
author = {Alejandro Barredo-Arrieta and Javier Del Ser},
journal= {arXiv preprint arXiv:2003.11323},
year = {2020}
}
备注
7 pages, 5 figures. Accepted for its presentation at WCCI 2020