检测潜在局部对抗样本以实现人类可解释防御
机器学习
2018-09-10 v1 密码学与安全
机器学习
摘要
机器学习模型正日益被用于工业决策,如信用保险审批。一些人可能试图操纵特定变量(如年龄或薪水)以获得更好的审批机会。在这项进行中的工作中,我们提出讨论并以一个初步方案解决在经典表格数据上检测潜在局部对抗样本的问题,通过向人类专家提供分类器决策中局部关键特征,以控制所提供的信息并避免欺诈。
引用
@article{arxiv.1809.02397,
title = {Detecting Potential Local Adversarial Examples for Human-Interpretable Defense},
author = {Xavier Renard and Thibault Laugel and Marie-Jeanne Lesot and Christophe Marsala and Marcin Detyniecki},
journal= {arXiv preprint arXiv:1809.02397},
year = {2018}
}
备注
presented at 2018 ECML/PKDD Workshop on Recent Advances in Adversarial Machine Learning (Nemesis 2018), Dublin, Ireland