中文

召唤恶魔并束缚之:LLM 红队测试的扎根理论

计算与语言 2024-12-12 v3 密码学与安全 人机交互

摘要

通过攻击大语言模型(LLM)故意生成异常输出是一种新颖的人类活动。本文基于广泛而多样的证据,对人们如何以及为何进行此类攻击进行了详尽阐述,并定义了 LLM 红队测试。采用形式化定性方法,我们访谈了来自广泛背景的数十位从业者,他们均为试图使 LLM 失效这一新颖工作的贡献者。我们聚焦于以下研究问题:定义 LLM 红队测试、揭示执行该活动的动机与目标,以及刻画人们攻击 LLM 时使用的策略。基于数据,LLM 红队测试被定义为一种寻求边界的、非恶意的、手动的活动,高度依赖团队协作与炼金术士心态。它高度由好奇心、乐趣以及在一定程度上对部署 LLM 各类危害的担忧所内在驱动。我们识别出 12 种攻击 LLM 的策略与 35 种不同技术的分类体系。这些发现作为关于人们如何及为何攻击大语言模型的全面扎根理论呈现:LLM 红队测试。

关键词

引用

@article{arxiv.2311.06237,
  title  = {Summon a Demon and Bind it: A Grounded Theory of LLM Red Teaming},
  author = {Nanna Inie and Jonathan Stray and Leon Derczynski},
  journal= {arXiv preprint arXiv:2311.06237},
  year   = {2024}
}