论安全自动化中被投毒的大语言模型的危险
密码学与安全
2025-11-05 v1 人工智能
摘要
本文研究了“大语言模型投毒”所引入的一些风险,即在模型训练过程中有意或无意地引入恶意或有偏见的数据。我们展示了一个看似改进的、在有限数据集上微调的大语言模型如何能够引入显著的偏见,以至于当提示利用该引入的偏见时,一个简单的基于大语言模型的告警调查员会被完全绕过。通过使用微调后的Llama3.1 8B和Qwen3 4B模型,我们演示了有针对性的投毒攻击如何使模型产生偏见,从而持续忽略来自特定用户的真实阳性告警。此外,我们提出了一些缓解措施和最佳实践,以增加在安全应用中部署的大语言模型的可信度、鲁棒性并降低风险。
引用
@article{arxiv.2511.02600,
title = {On The Dangers of Poisoned LLMs In Security Automation},
author = {Patrick Karlsen and Even Eilertsen},
journal= {arXiv preprint arXiv:2511.02600},
year = {2025}
}
备注
5 pages, 1 figure