WARD:针对提示注入攻击的 Web 代理对抗鲁棒防御
密码学与安全
2026-05-15 v1 人工智能
摘要
Web 代理可通过与网站交互来自主完成在线任务,但其暴露于开放式 Web 环境中,使其易受嵌入 HTML 内容或视觉界面中的提示注入攻击。现有警卫模型仍存在对未见域和攻击模式的泛化能力有限、对良性内容的误报率高、因在每一步添加延迟而导致部署效率低下,以及易受随时间演化或直接针对警卫本身的对抗攻击的威胁。为解决这些限制,我们提出了WARD(Web Agent Robust Defense against Prompt Injection),即为安全且高效的 Web 代理构建的实用警卫模型。WARD基于WARD-Base 构建,该数据集包含约17.7万个样本,来自719个高流量 URL 和平台;以及WARD-PIG 数据集,旨在针对警卫模型的提示注入攻击而设计。我们进一步引入A3T(adaptive adversarial attack training),通过基于记忆的攻击者与警卫协同演化过程,不断强化WARD。大量实验表明,WARD在分布外基准测试中几乎实现完美召回率,保持低误报率以保留代理实用性,在分布显著变化的情况下对警卫目标攻击和自适应攻击保持鲁棒性,能够在不引入额外延迟的情况下与代理并行高效运行。
引用
@article{arxiv.2605.15030,
title = {WARD: Adversarially Robust Defense of Web Agents Against Prompt Injections},
author = {Tri Cao and Yulin Chen and Hieu Cao and Yibo Li and Khoi Le and Thong Nguyen and Yuexin Li and Yufei He and Yue Liu and Shuicheng Yan and Bryan Hooi},
journal= {arXiv preprint arXiv:2605.15030},
year = {2026}
}
备注
Code and models: https://github.com/caothientri2001vn/WARD-WebAgent