面向基于LLM的多智能体系统的知识产权泄露攻击
密码学与安全
2025-06-18 v3 人工智能
计算与语言
摘要
大语言模型(LLM)的快速发展催生了基于多智能体系统(MAS)以协作方式执行复杂任务的趋势。然而,MAS的复杂结构和智能体间交互引发了对知识产权(IP)保护的重大关切。本文引入MASLEAK,一个 novel 的攻击框架,用于从MAS应用中提取敏感信息。MASLEAK针对实际的黑盒场景,即攻击者对MAS的体系结构或智能体配置毫无先验知识,只能通过公开API与MAS交互,提交攻击查询q并观察最终智能体的输出。受计算机蠕虫传播和感染脆弱网络主机方式的启发,MASLEAK精心构建对抗查询q,以引导、传递并保留来自MAS各智能体的响应,从而揭露一整套专有组件,包括智能体数量、系统拓扑、系统提示、任务指令及工具使用情况。我们构建了首个包含810个MAS应用的合成数据集,并评估了MASLEAK针对实际MAS应用(包括Coze和CrewAI)的效果。实验结果显示,MASLEAK在提取MAS知识产权方面达到了高准确率,系统提示和任务指令的平均攻击成功率为87%,在大多数情况下系统架构提取成功率达92%。我们通过讨论发现的意义和潜在防御措施来总结本文工作。
引用
@article{arxiv.2505.12442,
title = {IP Leakage Attacks Targeting LLM-Based Multi-Agent Systems},
author = {Liwen Wang and Wenxuan Wang and Shuai Wang and Zongjie Li and Zhenlan Ji and Zongyi Lyu and Daoyuan Wu and Shing-Chi Cheung},
journal= {arXiv preprint arXiv:2505.12442},
year = {2025}
}