反向攻击 AI 攻击者:将提示注入作为对抗 LLM 驱动的网络攻击的防御
密码学与安全
2024-11-19 v2 人工智能
摘要
大型语言模型 (LLM) 正日益被用于自动化网络攻击,使高级攻击手段更加可及和可扩展。作为应对,本文提出了一种针对 LLM 驱动网络攻击的新型防御策略。我们引入 Mantis,一种利用 LLM 对对抗性输入的脆弱性来削弱恶意操作的防御框架。 upon 检测到自动化网络攻击后,Mantis 会将精心构建的输入植入系统响应中,导致攻击者的 LLM 破坏其自身操作(被动防御)或甚至破坏攻击者的机器(主动防御)。通过部署目的是易受攻击的伪装服务吸引攻击者并使用动态提示注入攻击者的 LLM,Mantis 能够自主地反向攻击攻击者。在我们的实验中,Mantis 对自动化 LLM 驱动的攻击 consistently 达到了 95% 以上的有效性。为促进进一步的研究和合作,Mantis 作为开源工具提供:https://github.com/pasquini-dario/project_mantis
关键词
引用
@article{arxiv.2410.20911,
title = {Hacking Back the AI-Hacker: Prompt Injection as a Defense Against LLM-driven Cyberattacks},
author = {Dario Pasquini and Evgenios M. Kornaropoulos and Giuseppe Ateniese},
journal= {arXiv preprint arXiv:2410.20911},
year = {2024}
}
备注
v0.2 (evaluated on more agents)