中文

MIP对Agent: 恶意图像块劫持多模态OS代理

密码学与安全 2026-01-28 v3 机器学习

摘要

近期来,操作系统 (OS) 代理的进展使得视觉语言模型 (VLM) 能够直接控制用户的计算机。与传统 VLM 被动输出文本不同,OS 代理会自动响应单个用户提示,在计算机上执行自主任务。OS 代理通过捕获、解析和分析屏幕截图,并通过应用程序编程接口 (API) 如鼠标点击和键盘输入等执行低层操作。这种对 OS 的直接交互显著提高了风险,因为失败或操纵可能立即产生实际后果。在本工作中,我们发现了一种针对这些 OS 代理的新型攻击向量:恶意图像块 (MIP),是一种针对性地扰动的屏幕区域,当被 OS 代理捕获时,会通过利用特定 API 诱导其执行有害操作。例如,MIP 可嵌入桌面壁纸或在社交媒体上共享,以致使 OS 代理窃取敏感用户数据。我们表明,MIP 在用户提示和屏幕配置之间具有普遍性,并且可以在执行 benign 指令期间劫持多个 OS 代理。这些发现暴露了 OS 代理存在的关键安全漏洞,在其广泛部署之前必须仔细加以解决。

关键词

引用

@article{arxiv.2503.10809,
  title  = {MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents},
  author = {Lukas Aichberger and Alasdair Paren and Guohao Li and Philip Torr and Yarin Gal and Adel Bibi},
  journal= {arXiv preprint arXiv:2503.10809},
  year   = {2026}
}

备注

NeurIPS 2025