中文

对抗攻击揭示的大语言模型漏洞综述

计算与语言 2023-10-18 v1 密码学与安全 机器学习

摘要

大语言模型(LLMs)在架构与能力上迅猛发展,随着它们更深地融入复杂系统,审视其安全特性的紧迫性也与日俱增。本文综述了针对 LLM 的对抗攻击这一新兴交叉领域的研究——它是可信机器学习(trustworthy ML)的一个子领域,融合了自然语言处理与安全学的视角。已有工作表明,即便是经过安全对齐的 LLM(通过指令微调和基于人类反馈的强化学习),也可能易受对抗攻击的影响,这类攻击利用模型弱点并误导 AI 系统,ChatGPT 和 Bard 等模型上普遍存在的“越狱(jailbreak)”攻击便是明证。在本综述中,我们首先概述大语言模型,描述其安全对齐,并依据不同学习结构对现有研究分类:纯文本攻击、多模态攻击,以及专门针对复杂系统(如联邦学习或多智能体系统)的额外攻击方法。我们还对聚焦于漏洞根本来源与潜在防御的工作给出了全面评述。为使该领域对新人更友好,我们系统梳理了现有工作,给出了对抗攻击概念的结构化类型学,以及额外资源,包括第 62 届计算语言学会年会(ACL'24)上相关主题的演示幻灯片。

关键词

引用

@article{arxiv.2310.10844,
  title  = {Survey of Vulnerabilities in Large Language Models Revealed by Adversarial Attacks},
  author = {Erfan Shayegani and Md Abdullah Al Mamun and Yu Fu and Pedram Zaree and Yue Dong and Nael Abu-Ghazaleh},
  journal= {arXiv preprint arXiv:2310.10844},
  year   = {2023}
}