中文

面向网络漏洞相关推文的无监督分类与数据挖掘框架

机器学习 2021-04-26 v1

摘要

许多网络防御工具依赖国家漏洞数据库(NVD)来提供给定网络上各系统已知漏洞的及时信息。然而,近期研究表明 NVD 并非总是最新,已知漏洞在公开于 NVD 前数月便已在 Twitter 和 Reddit 等社交媒体平台上被公开讨论。为此,我们提出一个用于无监督分类以筛选与网络安全相关推文的框架。我们考量并评估了两种纳入框架的无监督机器学习技术,表明使用双向自回归 Transformer(BART)模型的零样本分类以 83.52% 的准确率和 83.88 的 F1 分数优于另一种技术,从而可在无人工干预或训练标注数据的情况下准确筛选推文。此外,我们讨论了可从这些网络相关推文中获得的多种洞见,例如推文趋势主题以及常见漏洞和暴露(CVE)的 Twitter 提及次数,这些可用于告警或报告以补充当前基于 NVD 的风险评估工具。

关键词

引用

@article{arxiv.2104.11695,
  title  = {A Framework for Unsupervised Classificiation and Data Mining of Tweets about Cyber Vulnerabilities},
  author = {Kenneth Alperin and Emily Joback and Leslie Shing and Gabe Elkin},
  journal= {arXiv preprint arXiv:2104.11695},
  year   = {2021}
}