基于自动生成奖励和多步骤强化学习的多样且高效红队测试
机器学习
2024-12-30 v1 人工智能
计算与语言
摘要
自动化红队测试可以发现罕见的模型失效并生成可用于训练或评估的具有挑战性的示例。然而,自动化红队测试的核心挑战在于确保攻击既具有多样性又具有有效性。以往方法通常在优化多样性或有效性方面取得成功,却很少两者兼备。本文提供的方法使自动化红队测试能够生成大量具有多样性且成功的攻击。我们的方法将任务分解为两个步骤:(1)自动生成具有多样性的攻击目标,(2)为这些目标生成有效的攻击。虽然我们提供了多种简单的方法来生成具有多样性的目标,但我们的关键贡献在于训练一个 RL 攻击者,既遵循这些目标又为这些目标生成具有多样性的攻击。首先,我们证明了使用大语言模型(LLM)生成具有多样性的攻击目标是容易的,这些目标通过单目标提示和奖励生成,包括基于规则的奖励(RBRs)来评估攻击是否针对特定目标成功。其次,我们展示了通过多步骤强化学习训练攻击者模型——即该模型因生成与过去尝试不同的攻击而获得奖励——可进一步提高多样性,同时保持有效性。我们使用本方法生成了提示注入攻击以及可诱发不安全响应的提示。在两种情况下,我们发现本方法能够生成高度有效且显著比以往通用红队测试方法更具多样性的攻击。
引用
@article{arxiv.2412.18693,
title = {Diverse and Effective Red Teaming with Auto-generated Rewards and Multi-step Reinforcement Learning},
author = {Alex Beutel and Kai Xiao and Johannes Heidecke and Lilian Weng},
journal= {arXiv preprint arXiv:2412.18693},
year = {2024}
}