中文

WIPI:针对 LLM 驱动的 Web 代理的新型 Web 威胁

密码学与安全 2024-02-28 v1 人工智能

摘要

随着大型语言模型(LLM)的快速发展,LLM 驱动的 Web 代理(简称 Web 代理)因其卓越的能力受到了广泛关注,在这些系统中,LLM 充当类似于人脑的核心决策部分,配备多种 Web 工具以主动与外部部署的网站进行交互。随着无数 Web 代理的发布,此类 LLM 系统正在经历快速发展并日益接近在我们日常生活中的广泛部署,一个本质且紧迫的问题随之产生:“这些 Web 代理安全吗?”。在本文中,我们引入了一种新型威胁 WIPI,它通过间接控制 Web 代理执行嵌入在公开可访问网页中的恶意指令。为了在黑盒环境中成功发起 WIPI 攻击,该方法聚焦于外部网页中间接指令的形式与内容,从而提升攻击的效率与隐蔽性。为了评估所提方法的有效性,我们使用 7 个基于插件的 ChatGPT Web 代理、8 个 Web GPT 以及 3 个不同的开源 Web 代理进行了大量实验。结果表明,即使在纯黑盒场景下,我们的方法也实现了超过 90% 的平均攻击成功率(ASR)。此外,通过考察各种用户前缀指令的消融研究,我们证明了 WIPI 表现出极强的鲁棒性,在多样的前缀指令下均能保持高性能。

关键词

引用

@article{arxiv.2402.16965,
  title  = {WIPI: A New Web Threat for LLM-Driven Web Agents},
  author = {Fangzhou Wu and Shutong Wu and Yulong Cao and Chaowei Xiao},
  journal= {arXiv preprint arXiv:2402.16965},
  year   = {2024}
}