利用基于神经网络的序列标注从网络安全文章非结构化文本中收集入侵指示器
计算与语言
2019-09-30 v2 机器学习
摘要
入侵指示器(IOCs)是在网络或操作系统中观测到的可用于指示计算机入侵并早期检测网络攻击的工件。因此,它们在网络安全领域发挥着重要作用。然而,最先进的IOC检测系统严重依赖具有网络安全专家知识的手工特征,并需要大规模人工标注语料来训练IOC分类器。本文提出使用端到端基于神经网络的序列标注模型,无需网络安全专家知识即可从网络安全文章中自动识别IOC。通过使用多头自注意力模块与上下文特征,我们发现所提模型能够收集网络安全文章文本的上下文信息,并在IOC识别任务中表现更优。实验表明,所提模型优于其他序列标注模型,在英语网络安全文章测试集上取得89.0%的平均F1分数,在中文测试集上取得约81.8%的平均F1分数。
引用
@article{arxiv.1907.02636,
title = {Collecting Indicators of Compromise from Unstructured Text of Cybersecurity Articles using Neural-Based Sequence Labelling},
author = {Zi Long and Lianzhi Tan and Shengping Zhou and Chaoyang He and Xin Liu},
journal= {arXiv preprint arXiv:1907.02636},
year = {2019}
}
备注
IJCNN 2019. arXiv admin note: substantial text overlap with arXiv:1810.10156