基于梯度的语言模型红队测试
计算与语言
2024-01-31 v1
摘要
红队测试是识别生成式语言模型 (LM) 弱点的一种常见策略,通过产生对抗性提示来触发 LM 生成不安全的响应。红队测试对于模型对齐和评估都至关重要,但由人类完成时劳动强度大且难以扩展。在本文中,我们提出了基于梯度的红队测试 (GBRT),这是一种红队测试方法,用于自动生成多样化的提示,这些提示很可能导致 LM 输出不安全的响应。GBRT 是一种提示学习形式,通过使用安全分类器对 LM 响应进行评分,然后通过冻结的安全分类器和 LM 进行反向传播以更新提示来进行训练。为了提高输入提示的连贯性,我们引入了两种变体,一种添加了真实性损失,另一种微调预训练模型来生成提示,而不是直接学习提示。我们的实验表明,GBRT 在寻找触发 LM 生成不安全响应的提示方面,比一种强大的基于强化学习的红队测试方法更有效,并且即使在 LM 经过微调以产生更安全输出的情况下也能成功。
引用
@article{arxiv.2401.16656,
title = {Gradient-Based Language Model Red Teaming},
author = {Nevan Wichers and Carson Denison and Ahmad Beirami},
journal= {arXiv preprint arXiv:2401.16656},
year = {2024}
}
备注
EACL 2024 main conference