基于可解释机器学习的医疗数据攻击无关对抗检测
机器学习
2021-05-06 v1 密码学与安全
摘要
可解释机器学习已变得日益普遍,尤其在医疗领域,可解释模型对于道德且可信的自动化决策至关重要。关于深度学习模型易受对抗攻击的脆弱性的工作已表明,设计样本以误导模型做出错误预测十分容易。在这项工作中,我们提出了一种模型无关、基于可解释性的方法,用于在具有不同复杂性与属性的两个数据集上准确检测对抗样本:电子健康记录(EHR)与胸部 X 光(CXR)数据。在 MIMIC-III 与 Henan-Renmin EHR 数据集上,我们针对纵向对抗攻击(Longitudinal Adversarial Attack)报告了 77% 的检测准确率。在 MIMIC-CXR 数据集上,我们达到了 88% 的准确率;在所有设定下均显著优于最先进(SOTA)的对抗检测水平,在两个数据集中均提升超过 10%。我们提出了一种基于异常检测、利用可解释性技术检测对抗样本的方法,其能够泛化至不同攻击方法而无需重新训练。
引用
@article{arxiv.2105.01959,
title = {Attack-agnostic Adversarial Detection on Medical Data Using Explainable Machine Learning},
author = {Matthew Watson and Noura Al Moubayed},
journal= {arXiv preprint arXiv:2105.01959},
year = {2021}
}
备注
13 pages, 6 figures, accepted to ICPR 2020