中文

防御 LLM 的提示注入攻击

密码学与安全 2025-12-02 v1 计算与语言 机器学习

摘要

大型语言模型 (LLM) 正在增多地部署于实际应用中,但其灵活性使其暴露于提示注入攻击。这些攻击利用模型的指令遵循能力,使其执行恶意任务。最近的工作提出了 JATMO,这是一种针对特定任务的微调方法,通过训练非指令微调的基础模型以执行单一功能,从而降低对对抗指令的敏感性。本研究评估了 JATMO 针对 HOUYI 的鲁棒性,HOUYI 是一个遗传攻击框架,系统性地变异和优化对抗提示。我们改进 HOUYI,引入自定义适应度评分、修改的变异逻辑以及新的本地模型测试框架,以实现更准确的防御有效性评估。我们按照 JATMO 方法微调了 LLaMA 2-7B、Qwen1.5-4B 和 Qwen1.5-0.5B 模型,并将其与微调的 GPT-3.5-Turbo 基线进行比较。结果表明,尽管 JATMO 相对于指令微调模型降低了攻击成功率,但并未完全防止注入;利用多语言线索或代码相关干扰因素的对手仍能绕过防御。我们还观察到生成质量与注入脆弱性之间存在权衡,表明更好的任务性能往往与增加的脆弱性相关联。我们的结果既凸显了基于微调的防御的前景,也凸显了其局限性,指向需要基于分层、对抗性信息的缓解策略的方向。

关键词

引用

@article{arxiv.2512.01326,
  title  = {Securing Large Language Models (LLMs) from Prompt Injection Attacks},
  author = {Omar Farooq Khan Suri and John McCrae},
  journal= {arXiv preprint arXiv:2512.01326},
  year   = {2025}
}

备注

10 pages, 1 figure, 1 table