中文

WebInject:针对网页智能体的提示注入攻击

机器学习 2025-10-20 v4 人工智能 计算与语言 计算机视觉与模式识别

摘要

基于多模态大语言模型(MLLM)的网页智能体通过根据网页截图生成动作来与网页环境交互。在这项工作中,我们提出了 WebInject,一种通过操纵网页环境来诱导网页智能体执行攻击者指定动作的提示注入攻击。我们的攻击向渲染网页的原始像素值添加扰动。这些扰动像素被映射到截图后,会诱导网页智能体执行攻击者指定的动作。我们将寻找扰动的问题形式化为一个优化问题。解决此问题的一个关键挑战是原始像素值与截图之间的映射是不可微的,这使得难以将梯度反向传播到扰动。为了克服这一点,我们训练一个神经网络来近似该映射,并应用投影梯度下降法来解决重新形式化的优化问题。在多个数据集上的广泛评估表明,WebInject 非常有效,并且显著优于基线方法。

关键词

引用

@article{arxiv.2505.11717,
  title  = {WebInject: Prompt Injection Attack to Web Agents},
  author = {Xilong Wang and John Bloch and Zedian Shao and Yuepeng Hu and Shuyan Zhou and Neil Zhenqiang Gong},
  journal= {arXiv preprint arXiv:2505.11717},
  year   = {2025}
}

备注

Appeared in EMNLP 2025 main conference. To better understand prompt injection attacks, see https://people.duke.edu/~zg70/code/PromptInjection.pdf