中文

SecureBERT:一种面向网络安全的领域特定语言模型

计算与语言 2022-10-24 v3 人工智能 密码学与安全

摘要

自然语言处理(NLP)近来在网络安全领域受到广泛关注,特别是在网络威胁情报(CTI)与网络自动化方面。连接与自动化的增强彻底改变了世界的经济与文化基础设施,同时也带来了网络攻击方面的风险。CTI 是帮助网络安全分析师做出智能安全决策的信息,通常以自然语言文本形式提供,在用于自动化安全措施之前,必须通过自动化流程转换为机器可读格式。本文提出 SecureBERT,一种能够捕捉网络安全文本(如 CTI)中文本内涵的网络安全语言模型,因此在许多关键网络安全任务的自动化中取得成功,否则这些任务将依赖人类专业知识和耗时的手动工作。SecureBERT 已使用大规模网络安全文本语料库进行训练。为使 SecureBERT 不仅在保留通用英语理解能力上有效,而且在应用于具有网络安全含义的文本时也有效,我们开发了定制分词器以及一种调整预训练权重的方法。SecureBERT 使用标准掩码语言模型(MLM)测试以及另外两个标准 NLP 任务进行评估。我们的评估研究表明,SecureBERT\footnote{\url{https://github.com/ehsanaghaei/SecureBERT}} 优于现有类似模型,确认了其在解决网络安全关键 NLP 任务方面的能力。

关键词

引用

@article{arxiv.2204.02685,
  title  = {SecureBERT: A Domain-Specific Language Model for Cybersecurity},
  author = {Ehsan Aghaei and Xi Niu and Waseem Shadid and Ehab Al-Shaer},
  journal= {arXiv preprint arXiv:2204.02685},
  year   = {2022}
}

备注

This is the initial draft of this work and it may contain errors and typos. The revised version has already been submitted to a venue