不要点击那个:教导 Web 智能体抵御欺骗性界面
人工智能
2026-05-12 v1 密码学与安全
摘要
基于视觉语言模型 (VLM) 的 Web 智能体展现出令人印象深刻的自主 GUI 交互能力,但仍然容易受到欺骗性界面元素的影响。现有方法要么在不结合任务的情况下检测欺骗,要么记录攻击而不提出防御。我们将欺骗感知的 Web 智能体防御形式化,并提出 DUDE(欺骗性 UI 检测器与评估器),这是一个两阶段框架,将混合奖励学习与不对称惩罚及经验总结相结合,将失败模式提炼为可迁移的指导。我们引入了 RUC(真实 UI 点击框),这是一个包含 1,407 个场景的基准,涵盖四个领域与欺骗类别。实验表明,DUDE 在保持任务性能的同时将欺骗易感性降低了 53.8%,为稳健的 Web 智能体部署奠定了有效基础。
引用
@article{arxiv.2605.09497,
title = {Don't Click That: Teaching Web Agents to Resist Deceptive Interfaces},
author = {Yilin Zhang and Yingkai Hua and Chunyu Wei and Xin Wang and Yueguo Chen},
journal= {arXiv preprint arXiv:2605.09497},
year = {2026}
}
备注
Accepted to ACL 2026 Main Conference. 23 pages, 8 figures, 19 tables