代理系统的守护者:通过代理系统防止多 shots 越狱攻击
密码学与安全
2025-06-13 v4
摘要
使用大型语言模型的自主 AI 代理在社会各领域创造了不可否认的价值,但它们面临来自对抗者的安全威胁,需要立即采取保护措施,因为信任和安全问题随之出现。考虑多 shots 越狱攻击和欺骗性对齐作为一些主要的先进攻击,这些攻击无法通过监督训练期间使用的静态护栏来缓解,这指出了真实世界鲁棒性的一个关键研究优先事项。静态护栏与动态多智能体系统的结合无法抵御这些攻击。我们旨在通过开发新的评估框架来增强基于 LLM 的代理的安全性,这些框架能够识别并对抗安全运营部署中的威胁。我们的工作使用三种检测方法,通过逆向图灵测试检测异常智能体,并通过多智能体模拟分析欺骗性对齐,以及通过工具介导的对抗场景测试反越狱系统,检测对象包括 GEMINI 1.5 pro、llama-3.3-70B 和 deepseek r1 模型。检测能力很强,例如 GEMINI 1.5 pro 的准确率达到 94%,但系统在长期攻击下仍存在持续漏洞,因为提示词长度增加会导致攻击成功率(ASR)上升,多样性指标在预测中变得无效,同时暴露出多个复杂的系统缺陷。研究结果表明,有必要采用基于主动监测的灵活安全系统,由代理自身执行,并结合系统管理员的适应性干预,因为当前模型会产生可能导致系统不可靠和脆弱的漏洞。因此,在我们的工作中,我们试图解决此类情况并提出一个全面的框架来对抗安全问题。
引用
@article{arxiv.2502.16750,
title = {Guardians of the Agentic System: Preventing Many Shots Jailbreak with Agentic System},
author = {Saikat Barua and Mostafizur Rahman and Md Jafor Sadek and Rafiul Islam and Shehenaz Khaled and Ahmedul Kabir},
journal= {arXiv preprint arXiv:2502.16750},
year = {2025}
}
备注
18 pages, 7 figures