中文

用于检测数据泄露的机器学习:综述

密码学与安全 2021-03-23 v2 机器学习

摘要

背景:网络安全、机器学习(ML)与软件工程(SE)交叉领域的研究近期在提出检测复杂数据泄露攻击的对策方面取得了显著进展。系统地回顾与综合基于 ML 的数据泄露对策,以构建关于这一重要主题的知识体系十分重要。目标:本文旨在系统回顾基于 ML 的数据泄露对策,识别并分类用于这些对策的 ML 方法、特征工程技术、评估数据集与性能指标。本综述也旨在识别基于 ML 的数据泄露对策研究中的空白。方法:我们使用系统文献综述(SLR)方法筛选并回顾了 {92} 篇论文。结果:该综述使我们能够(a)将对策中使用的 ML 方法分类为数据驱动与行为驱动方法,(b)将特征分为六类:行为、基于内容、统计、句法、空间与时间,(c)将评估数据集分类为模拟、合成与真实数据集,以及(d)识别这些研究使用的 11 项性能指标。结论:我们总结如下:(i)应探索数据驱动与行为驱动方法的融合;(ii)需要开发高质量且大规模评估数据集;(iii)对策中应引入增量式 ML 模型训练;(iv)在对策开发过程中应考虑并探索对对抗学习的鲁棒性,以避免投毒攻击;(v)应鼓励使用自动化特征工程以高效检测数据泄露攻击。

关键词

引用

@article{arxiv.2012.09344,
  title  = {Machine Learning for Detecting Data Exfiltration: A Review},
  author = {Bushra Sabir and Faheem Ullah and M. Ali Babar and Raj Gaire},
  journal= {arXiv preprint arXiv:2012.09344},
  year   = {2021}
}