中文

探索、确立、利用:从零开始对语言模型进行红队测试

计算与语言 2023-10-12 v3 人工智能 机器学习

摘要

部署大语言模型(LMs)可能因有害输出(如毒性或虚假文本)而带来危害。已有工作引入了自动化工具来诱发有害输出以识别这些风险。虽然这是保障模型安全的有价值一步,但这些方法依赖于预先存在的、能高效分类不良输出的方式。使用预训练分类器无法使红队测试针对目标模型量身定制。此外,当失败可被轻易预先分类时,红队测试的边际价值有限,因为问题可通过简单过滤训练数据和/或模型输出来避免。在此,我们考虑“从零开始”的红队测试,即攻击者起初并无分类失败的方法。我们的框架包含三步:1)在期望的上下文中探索模型的行为范围;2)确立不良行为的定义与度量(例如,训练一个反映人类评估的分类器);3)利用该度量发掘模型的缺陷,以开发多样的对抗性提示。我们使用此方法对 GPT-3 进行红队测试,发现了引发虚假陈述的输入类别。在此过程中,我们构建了 CommonClaim 数据集,包含 20,000 条由人类标注为常识真、常识假或两者的陈述。我们正公开代码与数据。

关键词

引用

@article{arxiv.2306.09442,
  title  = {Explore, Establish, Exploit: Red Teaming Language Models from Scratch},
  author = {Stephen Casper and Jason Lin and Joe Kwon and Gatlen Culp and Dylan Hadfield-Menell},
  journal= {arXiv preprint arXiv:2306.09442},
  year   = {2023}
}