中文

GUIGuard-Bench:面向隐私保护 GUI 智能体的通用评估

密码学与安全 2026-05-14 v3 人工智能 计算机视觉与模式识别

摘要

随着 GUI 智能体越来越依赖屏幕截图来感知和操作数字环境,它们可能会无意中暴露敏感信息,如身份、账户、位置和行为轨迹。虽然现有的基准主要关注任务完成、定位或防御第三方攻击,但当前的视觉隐私数据集在很大程度上仍局限于静态自然图像,限制了它们捕捉 GUI 任务轨迹中隐私风险的上下文依赖性和任务相关性的能力。为了弥合这一差距,我们引入了 \textbf{GUIGuard-Bench},这是在基于轨迹的 GUI 工作流中研究隐私保护 GUI 智能体的第一步基准。GUIGuard-Bench 包含 241 条真实的 GUI 智能体轨迹,涵盖 Android 和 PC 环境中的 4,080 张屏幕截图。每张截图均在区域级别进行了标注,包含隐私边界框、语义隐私类别、风险等级,以及该隐私信息是否为完成任务所必需。基于这些标注,GUIGuard-Bench 支持三项互补评估:隐私识别、受保护截图下的离线规划保真度,以及不同保护策略对效用的影响。我们的结果表明,当前的模型通常能够检测截图是否包含隐私信息,但在细粒度定位、类别识别、风险评估和任务必要性判断方面存在困难。我们还发现,以 Claude Sonnet 4.6 为代表的闭源模型在 Android 环境中应用隐私保护后,能够保持基本一致的规划器语义。我们的结果强调,隐私识别是实用 GUI 智能体的关键瓶颈。项目:https://futuresis.github.io/GUIGuard-page/

关键词

引用

@article{arxiv.2601.18842,
  title  = {GUIGuard-Bench: Toward a General Evaluation for Privacy-Preserving GUI Agents},
  author = {Yanxi Wang and Zhiling Zhang and Wenbo Zhou and Weiming Zhang and Jie Zhang and Qiannan Zhu and Yu Shi and Shuxin Zheng and Jiyan He},
  journal= {arXiv preprint arXiv:2601.18842},
  year   = {2026}
}