中文

(A)I 看见你看不见的:利用第三方移动代理中的新攻击面

密码学与安全 2026-07-01 v1

摘要

由视觉语言模型(VLMs)驱动的第三方移动代理已成为自动化智能手机交互的一种有前景的范式。这些代理充当高权限决策者,通过截图感知设备状态并通过 VLM 推理执行操作,改变了代理应用与环境(即其他应用或操作系统)交互的方式。相应地,这种转变引入了新的攻击面,或将移动设备的良性/无害接口转变为可利用的接口。本文总结了第三方移动代理应用与通用应用在环境交互方面的关键差异,分析了代理的安全态势,并识别出与通用移动应用相比的两个独特攻击面:屏幕感知攻击面,利用人类视觉与机器视觉之间的差距;以及误用通道攻击面,拦截或操纵代理的执行流程。我们设计并实现了七种具体攻击,从潜意识文本注入和隐形像素区域利用到截图篡改和主机 PC 命令注入。我们对五个流行的移动代理框架的评估表明,恶意应用可以劫持代理操作并实现任意命令执行,即使没有任何特权权限,同时对用户保持视觉上不可区分。这些发现揭示了自主代理设计中的根本信任不匹配,并强调了在多租户平台上迫切需要感知感知的安全模型。

关键词

引用

@article{arxiv.2607.00333,
  title  = {(A)I Sees What You Don't: Exploiting New Attack Surfaces in Third-Party Mobile Agents},
  author = {Zidong Zhang and Zhentao Xie and Wenrui Diao and Jianliang Wu},
  journal= {arXiv preprint arXiv:2607.00333},
  year   = {2026}
}