中文

面向现实威胁的移动GUI智能体:我们是否已经准备好了?

密码学与安全 2026-04-15 v2 人工智能

摘要

近年来,受大型语言模型(LLM)驱动的移动GUI智能体取得了快速发展,这些智能体可以基于自然语言指令自主执行多样化的设备控制任务。这些智能体在标准基准测试上的准确率不断提高,导致了对大规模实际部署的期望,目前已经有几种商业智能体面向早期采用者发布并使用。然而,我们是否准备好将这些智能体集成到我们日常设备中作为系统构建模块了?我们认为,缺少对智能体在现实威胁下性能维持情况的重要部署前验证是关键问题。具体而言,与基于简单静态应用内容的现有基准测试不同(它们必须这样做才能确保不同测试之间的环境一致性),现实中的应用充满来自不可信第三方的内容,例如广告电子邮件、用户生成的帖子和媒体等。...为此,我们引入了可扩展的应用内容工具框架,以启用现有应用程序中灵活且有针对性的内容修改。利用这一框架,我们创建了一个包含动态任务执行环境和静态挑战性GUI状态数据集的测试套件。动态环境包含122个可复现的任务,静态数据集由来自商业应用构建的3000多个场景组成。我们对开源和商业GUI智能体进行了实验。我们的发现表明,所有受检验的智能体都因第三方内容而显著受到降低,动态和静态环境中的误导率分别为42.0%和36.1%。该框架和基准已发布于https://agenthazard.github.io。

关键词

引用

@article{arxiv.2507.04227,
  title  = {Mobile GUI Agents under Real-world Threats: Are We There Yet?},
  author = {Guohong Liu and Jialei Ye and Jiacheng Liu and Yuanchun Li and Wei Liu and Pengzhi Gao and Jian Luan and Yunxin Liu},
  journal= {arXiv preprint arXiv:2507.04227},
  year   = {2026}
}