从威胁报告到持续威胁情报:文本制品中攻击技术提取方法的比较
密码学与安全
2022-10-07 v1 机器学习
摘要
网络威胁态势在不断演变。因此,持续监控和共享威胁情报已成为各组织的优先事项。由网络安全供应商发布的威胁报告包含以非结构化文本格式编写的攻击战术、技术与过程(TTP)的详细描述。从这些报告中提取 TTP 有助于网络安全从业者和研究人员了解并适应不断演变的攻击,以及规划威胁缓解。研究人员已在文献中提出 TTP 提取方法,然而并非所有提出的方法都相互比较过或与基线比较过。\textit{本研究的目的是通过比较文献中 TTP 提取研究的底层方法,帮助网络安全研究人员和从业者选择用于监控和共享威胁情报的攻击技术提取方法。} 在这项工作中,我们从文献中识别出十项现有的 TTP 提取研究,并实现了其中五项方法。我们发现基于词频-逆文档频率(TFIDF)和潜在语义索引(LSI)的两种方法以 84\% 和 83\% 的 F1 分数优于其他三种方法。我们观察到所有方法的 F1 分数在类标签数量呈指数增长时均出现下降。我们还实现并评估了一种过采样策略以缓解类不平衡问题。此外,过采样提升了 TTP 提取的分类性能。我们根据发现为未来的网络安全研究人员提供建议,例如从大型语料库构建基准数据集,以及选择 TTP 的文本特征。我们的工作连同数据集和实现源代码,可作为网络安全研究人员测试和比较未来 TTP 提取方法性能的基线。
引用
@article{arxiv.2210.02601,
title = {From Threat Reports to Continuous Threat Intelligence: A Comparison of Attack Technique Extraction Methods from Textual Artifacts},
author = {Md Rayhanur Rahman and Laurie Williams},
journal= {arXiv preprint arXiv:2210.02601},
year = {2022}
}