中文

基于真实自传播恶意软件生成与标注网络流量

密码学与安全 2022-05-30 v2

摘要

检测或修复恶意网络活动的技术研发需要获取包含已标注恶意连接的多样化、真实且具时效性的数据集。缺乏此类数据时,上述技术便无法得到有意义的训练、测试与评估。包含伪造或合并网络流量的合成数据价值有限,因为即便是简单的机器学习(ML)算法也能轻易将其与真实流量区分。真实网络数据更可取,但其虽无处不在,却普遍兼具敏感性与缺乏真值标注的缺点,限制了其在 ML 研究中的效用。本文提出一种多层面方法,用于在从大型生产网络收集的匿名网络流量中生成带标注的恶意连接数据集。将真实恶意软件去武器化后引入这些网络中的模拟安全节点,以生成真实流量,同时保持充分隔离以保护真实数据与基础设施。在网络边缘收集包含该嵌入恶意软件流量的网络传感器数据,并匿名化以供研究使用。依照上述方法在两所主要教育机构收集并生成了网络流量。成果是一个高度真实、长期、多机构的数据集,其嵌入数据标签涵盖超 1.5 万亿条连接及超一 PB 传感器日志数据。该数据集的可用性通过其对我们的 AI/ML 研究项目的效用得以证明。

关键词

引用

@article{arxiv.2104.10034,
  title  = {On Generating and Labeling Network Traffic with Realistic, Self-Propagating Malware},
  author = {Molly Buchanan and Jeffrey W. Collyer and Jack W. Davidson and Saikat Dey and Mark Gardner and Jason D. Hiser and Jeffry Lang and Alastair Nottingham and Alina Oprea},
  journal= {arXiv preprint arXiv:2104.10034},
  year   = {2022}
}

备注

4+2 pages, 3 figures, 1 table, for AI4CS-SDM21