中文

邪恶天才:深入探究基于LLM的智能体安全性

计算与语言 2024-02-05 v2

摘要

大语言模型(LLMs)的快速发展重新激活了基于LLM的智能体,其在多种场景中展现出令人印象深刻的人类似行为和协作能力。然而,这些智能体也带来了一些独有的风险,源于交互环境的复杂性和工具的可用性。本文从智能体数量、角色定义和攻击层级三个角度深入探究基于LLM的智能体的安全性。具体而言,我们最初提出采用基于模板的攻击策略对基于LLM的智能体进行攻击,以发现智能体数量的影响。此外,为解决交互环境和角色特异性问题,我们引入邪恶天才(Evil Geniuses, EG),一种自主生成与原始角色相关提示的有效攻击方法,以考察不同角色定义和攻击层级下的影响。EG利用红蓝对抗演练,显著提升了生成提示的攻击性和与原始角色的相似度。我们基于GPT-3.5和GPT-4在CAMEL、Metagpt和ChatDev上的评估展示了高成功率。广泛的评估和讨论表明,这些智能体鲁棒性较差,更容易产生有害行为,并且比LLMs能够生成更隐蔽的内容,凸显了重大的安全挑战并指导未来研究。我们的代码可在 https://github.com/T1aNS1R/Evil-Geniuses 获取。

关键词

引用

@article{arxiv.2311.11855,
  title  = {Evil Geniuses: Delving into the Safety of LLM-based Agents},
  author = {Yu Tian and Xiao Yang and Jingyuan Zhang and Yinpeng Dong and Hang Su},
  journal= {arXiv preprint arXiv:2311.11855},
  year   = {2024}
}

备注

11 pages