中文

显而易见的隐形威胁:LLM驱动的GUI代理面临细则注入攻击

人机交互 2025-04-16 v1 计算与语言 密码学与安全

摘要

大型语言模型(LLM)驱动的GUI代理是一种特殊的自主系统,根据高级指令在用户 behalf 上执行任务。它通过感知和解释相关应用的图形用户界面(GUI),通常是视觉方式,推断必要的动作序列,然后通过执行点击、输入和点击等动作来与GUI交互。为了完成诸如填写表格或预订服务等实际任务,GUI代理通常需要处理和作用于敏感用户数据。然而,这种自主性引入了新的隐私和安全风险。对手可以将恶意内容注入GUI,从而改变代理行为或导致意外的私人信息披露。这些攻击常常利用代理与人类用户之间在视觉显著性上的差异,或代理检测任务自动化中上下文完整性违规行为的有限能力。在本文中,我们描述了六种此类攻击类型,并对这六种攻击类型在六个最先进的GUI代理、234个对抗网页和39名人类参与者身上进行的实验研究。我们的发现表明,GUI代理高度脆弱,尤其是针对嵌入式威胁。此外,人类用户也对许多这些攻击高度敏感,这表明简单的人员监督可能不可靠地防止故障。这种误差凸显了面向隐私的代理设计的需要。我们提出了实用的防御策略,以促进更安全和更可靠的GUI代理开发。

关键词

引用

@article{arxiv.2504.11281,
  title  = {The Obvious Invisible Threat: LLM-Powered GUI Agents' Vulnerability to Fine-Print Injections},
  author = {Chaoran Chen and Zhiping Zhang and Bingcan Guo and Shang Ma and Ibrahim Khalilov and Simret A Gebreegziabher and Yanfang Ye and Ziang Xiao and Yaxing Yao and Tianshi Li and Toby Jia-Jun Li},
  journal= {arXiv preprint arXiv:2504.11281},
  year   = {2025}
}