VisualTrap:基于视觉定位操纵的GUI智能体隐蔽后门攻击
计算与语言
2025-09-25 v2 人工智能
摘要
由大型视觉语言模型(LVLMs)驱动的图形用户界面(GUI)智能体已涌现为一种革命性方法,能够自动化地在个人设备(如移动电话)或设备内的应用程序之间执行复杂的真实世界任务,以类人方式操作。然而,这些智能体与个人设备的密切集成引发了重大的安全关注,许多威胁,包括后门攻击,仍在很大程度上未被探索。本工作揭示了GUI智能体将文本计划映射到GUI元素的视觉定位可引入漏洞,从而 enable new types of backdoor attacks。通过针对视觉定位进行后门攻击,即使给定正确的任务解决计划,智能体的行为也能被劫持。为验证此漏洞,我们提出了VisualTrap方法,通过误导智能体将文本计划定位到触发位置而非预期目标位置来劫持视觉定位。VisualTrap使用注入带有毒素数据以进行攻击的常见方法,并在视觉定位的预训练期间进行,以确保攻击的实际可行性。实证结果表明,VisualTrap仅需5%的带毒数据即可有效劫持视觉定位,且具有高度隐蔽的视觉触发器(对人眼不可见);攻击可在干净微调后针对下游任务进行推广。此外,注入的触发器可在不同的GUI环境中保持有效,例如训练时使用的移动/网页环境可推广到桌面环境。这些发现凸显了针对GUI智能体后门攻击风险的紧迫需求。
引用
@article{arxiv.2507.06899,
title = {VisualTrap: A Stealthy Backdoor Attack on GUI Agents via Visual Grounding Manipulation},
author = {Ziang Ye and Yang Zhang and Wentao Shi and Xiaoyu You and Fuli Feng and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2507.06899},
year = {2025}
}
备注
Accepted in COLM2025