中文

评估多模态智能体对主动环境注入攻击的鲁棒性

计算与语言 2025-08-07 v3

摘要

随着研究人员不断优化AI智能体以在操作系统内更有效地执行任务,他们常常忽视一个关键的安全问题:这些智能体检测其环境中“冒名顶替者”的能力。通过分析智能体的操作上下文,我们识别出一个重大威胁——攻击者可以将恶意攻击伪装成环境元素,向智能体的执行过程中注入主动干扰以操纵其决策。我们将这种新型威胁定义为主动环境注入攻击(AEIA)。聚焦于Android操作系统的交互机制,我们对AEIA进行了风险评估,并识别出两个关键的安全漏洞:(1)多模态交互界面中的对抗性内容注入,攻击者将对抗性指令嵌入环境元素中以误导智能体决策;(2)智能体任务执行过程中的推理差距漏洞,这增加了推理过程中对AEIA攻击的敏感性。为了评估这些漏洞的影响,我们提出了AEIA-MN,一种利用移动操作系统交互漏洞来评估基于MLLM的智能体鲁棒性的攻击方案。实验结果表明,即使是先进的MLLM也极易受到这种攻击,在AndroidWorld基准测试中,通过结合两种漏洞,攻击成功率最高可达93%。

关键词

引用

@article{arxiv.2502.13053,
  title  = {Evaluating the Robustness of Multimodal Agents Against Active Environmental Injection Attacks},
  author = {Yurun Chen and Xavier Hu and Keting Yin and Juncheng Li and Shengyu Zhang},
  journal= {arXiv preprint arXiv:2502.13053},
  year   = {2025}
}

备注

Accepted at ACM MM 2025 Main Conference