中文

HoneyTrap:欺骗大语言模型攻击者的蜜罐陷阱——具备韧性的多智能体防御

密码学与安全 2026-01-08 v1 人工智能

摘要

越狱攻击对大语言模型(LLM)构成严重威胁,可能使攻击者绕过安全措施。然而,现有的被动防御方法难以跟上不断演化的多轮越狱攻击的速度,而攻击者会持续深化攻击以利用漏洞。为应对这一关键挑战,我们提出了 HoneyTrap——一种新型去中心化大语言模型防御框架,利用协作防御者来抵御越狱攻击。它集成了四个防御智能体:Threat Interceptor(威胁拦截器)、Misdirection Controller(误导控制器)、Forensic Tracker(取证追踪器)和 System Harmonizer(系统协调器),每个智能体执行特定的安全角色,并协作完成去中心化防御。为确保进行全面评估,我们引入了 MTJ-Pro——一个具有挑战性的多轮渐进式越狱数据集,组合了七种先进的越狱策略,旨在跨多轮攻击逐步深化攻击策略。此外,我们提出了两个新指标:误导成功率(MSR)和攻击资源消耗(ARC),提供了对去中心化防御更细致的评估,超越传统措施。在 GPT-4、GPT-3.5-turbo、Gemini-1.5-pro 和 LLaMa-3.1 上的实验结果表明,HoneyTrap 相较于最先进的基线方法平均降低了 68.77% 的攻击成功率。值得注意的是,在专门的自适应攻击者环境下,HoneyTrap 仍保持韧性,利用去中心化参与延长交互时间,显著增加成功利用所需的时间和计算成本。与简单拒绝不同,HoneyTrap 在不影响善意查询的前提下,策略性地浪费攻击者资源,分别将 MSR 和 ARC 提升了 118.11% 和 149.16%。

关键词

引用

@article{arxiv.2601.04034,
  title  = {HoneyTrap: Deceiving Large Language Model Attackers to Honeypot Traps with Resilient Multi-Agent Defense},
  author = {Siyuan Li and Xi Lin and Jun Wu and Zehao Liu and Haoyu Li and Tianjie Ju and Xiang Chen and Jianhua Li},
  journal= {arXiv preprint arXiv:2601.04034},
  year   = {2026}
}