SecEncoder:日志即是安全
密码学与安全
2024-11-13 v1 人工智能
计算与语言
机器学习
摘要
大型和小型语言模型(LMs)通常使用来自维基百科、语料库或通过网页抓取获得的大量文本进行预训练。由于这些模型暴露于广泛的语言数据,具有惊人的概括能力,可执行大量任务。然而,它们在领域特定任务方面常常不足,这是由于其广泛的训练数据所致。本文提出SecEncoder——一种使用安全日志预训练的专业小型语言模型。SecEncoder旨在通过专注于安全日志中独特语言和模式,解决通用语言模型在领域特定方面的局限。实验结果表明,SecEncoder在各种任务中均优于其他语言模型,包括BERTlarge、DeBERTa-v3-large和OpenAI的嵌入(textembedding-ada-002),这些模型主要使用自然语言进行预训练。此外,尽管SecEncoder主要在日志数据上预训练,但它在日志分析之外的诸多任务(如事件优先级排序和威胁情报文档检索)也优于基于自然语言预训练的模型。这表明以日志为特定领域预训练可显著提升语言模型在安全领域的性能。这些发现为未来研究安全特定语言模型及其潜在应用指明了方向。
引用
@article{arxiv.2411.07528,
title = {SecEncoder: Logs are All You Need in Security},
author = {Muhammed Fatih Bulut and Yingqi Liu and Naveed Ahmad and Maximilian Turner and Sami Ait Ouahmane and Cameron Andrews and Lloyd Greenwald},
journal= {arXiv preprint arXiv:2411.07528},
year = {2024}
}