基于语言模型迁移学习的攻击战术识别
密码学与安全
2022-09-02 v1
摘要
随着安全攻击与数据泄露的快速增长,网络安全已成为全球首要关切。人工智能有望协助人类分析与识别攻击。然而,为监督学习标注数百万数据包绝非易事。本研究旨在利用迁移学习技术,将明确定义的攻击生命周期文档中所获知识存储,并应用于数十万未标注攻击(数据包)以识别其攻击战术。我们预期攻击知识在文档中得到充分描述,且前沿的基于 transformer 的语言模型可将知识嵌入高维潜空间。随后,复用语言模型的信息以学习数据包所承载的攻击战术,从而提升学习效率。我们提出一个名为 PELAT 的系统,其利用来自 MITRE ATT&CK 生命周期框架的 1,417 篇文章微调 BERT 模型,以增强其攻击知识(包括所用语法与嵌入的语义)。PELAT 随后将其知识迁移,对未标注数据包执行半监督学习以生成战术标签。进一步,当新攻击数据包到达时,数据包载荷将由带下游分类器的 PELAT 语言模型处理以预测其战术。如此,我们可有效减轻手动标注大型数据集的负担。在一个为期一周的蜜罐攻击数据集(每日 227 千个数据包)上,PELAT 在测试集上取得精度、召回率与 F1 均为 99%。PELAT 可在另外两个测试数据集上推断超过 99% 的战术(而近 90% 的战术被识别)。
引用
@article{arxiv.2209.00263,
title = {Attack Tactic Identification by Transfer Learning of Language Model},
author = {Ling-Hsuan Lin and Shun-Wen Hsiao},
journal= {arXiv preprint arXiv:2209.00263},
year = {2022}
}
备注
13 pages, 7 figures, 6 tables