中文

ThreatCrawl:一种基于BERT的网络安全领域聚焦爬虫

密码学与安全 2025-03-25 v4 计算与语言 机器学习

摘要

公开可用信息中包含对网络威胁情报(CTI)有价值的信息。这可用于防范已在其他系统上发生的攻击。理想情况下,仅初始攻击成功,而所有后续攻击均被检测并阻止。但是,尽管存在不同的标准来交换此类信息,大量信息以非标准化的方式在文章或博客帖子中共享。手动浏览多个在线门户和新闻页面以发现新威胁并提取它们是一项耗时的任务。为使该扫描过程的部分实现自动化,已有多篇论文提出使用自然语言处理(NLP)从文档中提取失陷指标(IOC)的提取器。然而,尽管这已解决了从文档中提取信息的问题,对这些文档的搜索却很少被考虑。本文提出了一种称为ThreatCrawl的新型聚焦爬虫,它使用基于Bidirectional Encoder Representations from Transformers(BERT)的模型对文档进行分类并动态调整其爬取路径。虽然ThreatCrawl难以对文本中提及的开放式情报(OSINT)具体类型(例如IOC内容)进行分类,但它能成功找到相关文档并相应地修改其路径。其收获率高达52%,据我们所知,优于当前最先进水平。结果与源代码将在录用后公开。

关键词

引用

@article{arxiv.2304.11960,
  title  = {ThreatCrawl: A BERT-based Focused Crawler for the Cybersecurity Domain},
  author = {Philipp Kuehn and Mike Schmidt and Markus Bayer and Christian Reuter},
  journal= {arXiv preprint arXiv:2304.11960},
  year   = {2025}
}

备注

11 pages, 9 figures, 5 tables