计算机智能体中的上下文防御:一项实证研究
人工智能
2025-03-13 v1
摘要
由视觉语言模型驱动的计算机智能体极大地促进了人机交互,使用户能够通过自然语言指令执行复杂任务。然而,这些智能体容易受到上下文欺骗攻击的威胁,这是一种新兴威胁,攻击者将误导性内容嵌入智能体的操作环境中,例如包含欺骗性指令的弹出窗口。现有的防御措施,例如指示智能体忽略欺骗性元素,已被证明在很大程度上是无效的。作为保护计算机智能体的首次系统性研究,我们引入了上下文防御,利用上下文学习和思维链推理来对抗此类攻击。我们的方法通过在智能体的上下文中增加一小部分精心挑选的示例来增强智能体,这些示例包含恶意环境及相应的防御性响应。这些示例引导智能体在动作规划之前首先进行显式的防御性推理,从而降低其对欺骗性攻击的易感性。实验证明了我们方法的有效性,将弹出窗口攻击的攻击成功率降低了91.2%,将环境注入攻击的攻击成功率平均降低了74.6%,同时针对干扰性广告实现了100%的成功防御。我们的研究结果强调:(1) 防御性推理必须在动作规划之前进行以获得最佳性能,以及 (2) 极少数量的示例(少于三个)足以诱导智能体的防御行为。
引用
@article{arxiv.2503.09241,
title = {In-Context Defense in Computer Agents: An Empirical Study},
author = {Pei Yang and Hai Ci and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2503.09241},
year = {2025}
}