多智能体系统中的LLM到LLM提示感染
多智能体系统
2024-10-11 v1 人工智能
密码学与安全
摘要
随着大语言模型(LLM)日益强大,多智能体系统正在成为现代人工智能应用中越来越普遍的应用。然而,大多数安全研究仍然集中在单智能体LLM的漏洞上,包括提示注入攻击,即通过嵌入在外部内容中的恶意提示骗取LLM执行意外或有害操作,从而损害受害者应用程序的安全。在本文中,我们揭示了更危险的向量:多智能体系统中的LLM到LLM提示注入。我们引入了提示感染(Prompt Infection),这是一种 novel 攻击方式,恶意提示会在相互连接的智能体之间自我复制,行为类似于计算机病毒。这种攻击可能引发严重威胁,包括数据盗窃、诈骗、误导信息以及系统范围内的中断,同时通过系统静默传播。我们的广泛实验表明,即使智能体并不公开分享所有通信,多智能体系统也高度易受感染。为了应对这一问题,我们提出了LLM标记(LLM Tagging)一种防御机制,当与现有安全措施结合时,可显著减缓感染的传播。这一工作凸显了随着多智能体LLM系统更广泛采用,对先进安全措施的迫切需求。
引用
@article{arxiv.2410.07283,
title = {Prompt Infection: LLM-to-LLM Prompt Injection within Multi-Agent Systems},
author = {Donghyun Lee and Mo Tiwari},
journal= {arXiv preprint arXiv:2410.07283},
year = {2024}
}