更少数据,更多安全性:通过资源高效的领域适应连续预训练于最小化标记数实现网络安全LLM专精化
计算与语言
2025-07-08 v1 人工智能
密码学与安全
机器学习
摘要
尽管大型语言模型(Large Language Models, LLMs)展现出卓越的自然语言能力,但通用模型缺乏针对有效网络安全分析的专业领域知识。在本工作中,我们探索了领域适应连续预训练(Domain-Adaptive Continuous Pretraining, DAP)作为增强预训练大语言模型网络安全理解能力且保留通用语言能力的方法。我们系统性地对三个解码器架构——Llama-3.1-8B、DeepSeek-R1-Distill-Qwen-14B和Llama-3.3-70B-Instruct——进行了适配,采用来自标准、学术文献及其他来源的精选1.26亿词网络安全语料库。我们的做法采用受限训练参数和分布式FSDP训练,在领域专精化与知识保留之间进行权衡。在三个网络安全基准测试(CTI-MCQ、CyberMetric和SecEval)上的评估表明,适配后均实现了一致的性能提升。Llama-3.3-70B-Ins-DAP模型分别实现了0.718、0.933和0.864的state-of-the-art准确率,超越了包括Llama-Primus-Base在内的专业模型。值得注意的是,使用远小于数据集(1.188亿 versus 277亿标记)即可实现竞争性能,证明了高效领域专精化的可行性。我们确立了针对性连续预训练可实现有效网络安全领域适应且具备计算可行性,为威胁分析、漏洞评估和安全文档生成提供了基础,同时挑战了关于LLM专精化数据需求的既有假设。
引用
@article{arxiv.2507.02964,
title = {Less Data, More Security: Advancing Cybersecurity LLMs Specialization via Resource-Efficient Domain-Adaptive Continuous Pre-training with Minimal Tokens},
author = {Salahuddin Salahuddin and Ahmed Hussain and Jussi Löppönen and Toni Jutila and Panos Papadimitratos},
journal= {arXiv preprint arXiv:2507.02964},
year = {2025}
}
备注
15 Pages and 10 Figures