中文

直击阿喀琉斯之踵:生成式模型红队测试综述

计算与语言 2024-11-27 v2

摘要

生成式模型正迅速普及并融入日常应用,随着各种漏洞的暴露,其安全使用引发了担忧。有鉴于此,红队测试领域正快速发展,凸显了进行全面综述以覆盖整个流程并探讨新兴主题的需求。我们的广泛综述考察了120余篇论文,引入了一种基于语言模型内在能力的细粒度攻击策略分类法。此外,我们开发了“searcher”框架以统一各种自动红队测试方法。而且,我们的综述涵盖了包括多模态攻击与防御、基于LLM的智能体的风险、对无害查询的过度拒绝,以及无害性与有用性之间平衡等新领域。

关键词

引用

@article{arxiv.2404.00629,
  title  = {Against The Achilles' Heel: A Survey on Red Teaming for Generative Models},
  author = {Lizhi Lin and Honglin Mu and Zenan Zhai and Minghan Wang and Yuxia Wang and Renxi Wang and Junjie Gao and Yixuan Zhang and Wanxiang Che and Timothy Baldwin and Xudong Han and Haonan Li},
  journal= {arXiv preprint arXiv:2404.00629},
  year   = {2024}
}