CySecBERT:面向网络安全领域的领域自适应语言模型
密码学与安全
2022-12-07 v1 计算与语言
摘要
网络安全领域发展迅速。专家需要了解过去、当前以及——在最佳情况下——即将到来的威胁,因为攻击正变得更为先进、目标更大、系统更复杂。由于这无法手动应对,网络安全专家需要依赖机器学习技术。在文本领域,像 BERT 这样的预训练语言模型已被证明是有帮助的,为进一步微调提供了良好的基线。然而,由于网络安全领域存在领域知识以及大量技术术语,通用语言模型可能会误解文本信息的要旨,从而弊大于利。为此,我们构建了一个高质量数据集,并提出了一种专门面向网络安全领域的语言模型,可作为处理自然语言的网络安全系统的基本构建模块。该模型基于 15 项不同的领域相关外在和内在任务以及来自 SuperGLUE 基准的通用任务与其他模型进行了比较。一方面,内在任务的结果表明,与其他模型相比,我们的模型改进了词的内部表示空间。另一方面,由序列标注和分类组成的外在、领域相关任务表明,与其他模型不同,该模型在特定应用场景中表现最佳。此外,我们展示了我们针对灾难性遗忘的方法有效,因为该模型能够恢复先前训练的领域无关知识。所使用的数据集和训练好的模型已公开可用。
引用
@article{arxiv.2212.02974,
title = {CySecBERT: A Domain-Adapted Language Model for the Cybersecurity Domain},
author = {Markus Bayer and Philipp Kuehn and Ramin Shanehsaz and Christian Reuter},
journal= {arXiv preprint arXiv:2212.02974},
year = {2022}
}
备注
13 Pages, 7 tables, 1 figure