中文

纸牌屋摇摇欲坠?绘制针对语言智能体的对抗性攻击图谱

计算与语言 2024-02-16 v1 人工智能

摘要

由大型语言模型 (LLM) 驱动的语言智能体发展迅猛。其利用语言作为思维和沟通载体的能力赋予了极高的灵活性和多功能性。人们迅速利用这一能力将 LLM 连接到各种外部组件和环境:数据库、工具、互联网、机器人具身等。许多人认为一种前所未有的强大自动化技术正在兴起。然而,新的自动化技术伴随着新的安全风险,尤其是对于像语言智能体这样复杂的系统。其发展和部署的速度与规模与我们对其安全风险的理解之间存在惊人的巨大差距。我们是否在建造一座纸牌屋?在这篇立场论文中,我们提出了首次系统性地绘制针对语言智能体的对抗性攻击图谱的工作。我们首先提出了一个包含感知、大脑和行动三个主要组件的智能体统一概念框架。在此框架下,我们进行了全面讨论,并提出了针对智能体不同组件的 12 种潜在攻击场景,涵盖了不同的攻击策略(例如输入操纵、对抗性演示、越狱、后门)。我们还将其与先前应用于 LLM 的成功攻击策略联系起来。我们强调,在语言智能体广泛部署之前,亟需对其风险有透彻的理解。

关键词

引用

@article{arxiv.2402.10196,
  title  = {A Trembling House of Cards? Mapping Adversarial Attacks against Language Agents},
  author = {Lingbo Mo and Zeyi Liao and Boyuan Zheng and Yu Su and Chaowei Xiao and Huan Sun},
  journal= {arXiv preprint arXiv:2402.10196},
  year   = {2024}
}