中文

当心你的智能体!探究针对基于 LLM 的智能体的后门威胁

密码学与安全 2024-10-30 v2 人工智能 计算与语言

摘要

在大语言模型(LLM)快速发展的驱动下,基于 LLM 的智能体已被开发用于处理各种现实应用,包括金融、医疗和购物等。在应用过程中确保基于 LLM 的智能体的可靠性与安全性至关重要。然而,目前对基于 LLM 的智能体安全问题的研究尚不充分。在本研究中,我们迈出了第一步,探究针对基于 LLM 的智能体的一种典型安全威胁——后门攻击(backdoor attack)。我们首先构建了一个智能体后门攻击的一般框架,随后对智能体后门攻击的不同形式进行了全面分析。具体而言,与仅能操纵用户输入和模型输出的传统 LLM 后门攻击相比,智能体后门攻击展现出更加多样和隐蔽的形式:(1) 从最终攻击结果的角度来看,智能体后门攻击者不仅可以选择操纵最终输出分布,还可以仅在中间推理步骤中引入恶意行为,同时保持最终输出正确。(2) 此外,根据触发器位置的不同,前一类攻击可分为两个子类:后门触发器既可以隐藏在用户查询中,也可以出现在外部环境返回的中间观测中。我们在网页购物和工具利用这两个典型智能体任务上实现了上述不同变体的智能体后门攻击。大量实验表明,基于 LLM 的智能体严重受到后门攻击的威胁,且这种后门脆弱性无法被现有的文本后门防御算法轻易缓解。这表明迫切需要进一步研究开发针对基于 LLM 的智能体后门攻击的专门防御方法。警告:本文可能包含带有偏见的内容。

关键词

引用

@article{arxiv.2402.11208,
  title  = {Watch Out for Your Agents! Investigating Backdoor Threats to LLM-Based Agents},
  author = {Wenkai Yang and Xiaohan Bi and Yankai Lin and Sishuo Chen and Jie Zhou and Xu Sun},
  journal= {arXiv preprint arXiv:2402.11208},
  year   = {2024}
}

备注

Accepted at NeurIPS 2024, camera ready version. Code and data are available at https://github.com/lancopku/agent-backdoor-attacks