中文

从文本中识别与提取网络安全相关实体

计算与语言 2022-08-04 v1 人工智能 密码学与安全

摘要

网络威胁情报(Cyber Threat Intelligence, CTI)是描述威胁向量、漏洞和攻击的信息,常被用作基于 AI 的网络防御系统(如网络安全知识图谱(Cybersecurity Knowledge Graphs, CKG))的训练数据。迫切需要有社区可访问的数据集来训练现有基于 AI 的网络安全流水线,以从 CTI 中高效、准确地提取有意义的洞察。我们已从多种开放源创建了初始非结构化 CTI 语料库,用于借助 spaCy 框架训练与测试网络安全实体模型,并探索自动识别网络安全实体的自学习方法。我们还描述了应用网络安全领域实体链接与来自 Wikidata 的现有世界知识的方法。我们的未来工作将调研并测试 spaCy NLP 工具,并创建从文本提取新信息持续集成的方法。

关键词

引用

@article{arxiv.2208.01693,
  title  = {Recognizing and Extracting Cybersecurtity-relevant Entities from Text},
  author = {Casey Hanks and Michael Maiden and Priyanka Ranade and Tim Finin and Anupam Joshi},
  journal= {arXiv preprint arXiv:2208.01693},
  year   = {2022}
}