一种用于入侵检测系统可解释人工智能的对抗方法
机器学习
2018-11-29 v1 密码学与安全
机器学习
摘要
尽管现代机器学习技术(例如深度神经网络)在网络安全应用中日益流行,但大多数这些模型对用户而言仍是黑盒。对抗机器学习提供了一种增进我们对这些模型理解的方法。在本文中,我们提出一种为数据驱动的入侵检测系统(IDS)的错误分类生成解释的方法。采用对抗方法寻找正确分类给定误分类样本集所需的最小修改(对输入特征)。此类修改的幅度被用于可视化解释误分类原因的最相关特征。所提出的方法生成了令人满意的解释,描述了误分类背后的推理,其描述与专家知识相符。所提方法的优点为:1)适用于任何具有定义梯度的分类器。2)不需要对分类器模型做任何修改。3)可扩展以执行进一步诊断(例如漏洞评估)并增进对系统的理解。实验评估在 NSL-KDD99 基准数据集上使用线性和多层感知机分类器进行。结果通过直观的可视化展示,以改善结果的可解释性。
引用
@article{arxiv.1811.11705,
title = {An Adversarial Approach for Explainable AI in Intrusion Detection Systems},
author = {Daniel L. Marino and Chathurika S. Wickramasinghe and Milos Manic},
journal= {arXiv preprint arXiv:1811.11705},
year = {2018}
}