CyberLLMInstruct:揭示网络安全LLM微调中安全性-性能权衡的伪恶意数据集
密码学与安全
2025-09-18 v3 人工智能
摘要
大型语言模型(LLM)融入网络安全应用既带来了机遇,也带来了关键的安全风险。我们引入了CyberLLMInstruct,一个包含54,928个伪恶意指令-响应对的数据集,涵盖网络安全任务,包括恶意软件分析、钓鱼模拟和零日漏洞。我们的全面评估使用了七个开源LLM,揭示了一个关键权衡:虽然微调提升了网络安全任务性能(在CyberMetric上达到高达92.50%的准确率),但严重损害了所有被测试模型和攻击向量上的安全韧性(例如,Llama 3.1 8B对提示注入的安全分数从0.95降至0.15)。该数据集纳入了包括CTF挑战、学术论文、行业报告和CVE数据库在内的多样化来源,以确保网络安全领域的全面覆盖。我们的发现凸显了在对抗性领域保护LLM所面临的独特挑战,并确立了开发在安全敏感领域中平衡性能提升与安全性保持的微调方法的迫切需求。
引用
@article{arxiv.2503.09334,
title = {CyberLLMInstruct: A Pseudo-malicious Dataset Revealing Safety-performance Trade-offs in Cyber Security LLM Fine-tuning},
author = {Adel ElZemity and Budi Arief and Shujun Li},
journal= {arXiv preprint arXiv:2503.09334},
year = {2025}
}