通过对抗性防御训练的紫色测试 LLM
计算与语言
2024-07-03 v1
摘要
现有的 LLM 防护努力在积极暴露目标 LLM 漏洞方面受限,难以快速适应新出现的安全风险。为此,我们提出一种名为对抗性防御训练 (PAD) 的紫色测试 LLM 的管道,旨在通过新颖地将红队测试(攻击)和蓝队测试(安全训练)技术融合来防护 LLM。在 PAD 中,我们以自我对弈方式自动收集覆盖特定安全风险下 LLM 漏洞的对话数据,其中攻击者旨�引发不安全响应,而防御者则生成针对这些攻击的安全响应。随后,我们以生成对抗网络的方式更新两个模块:通过训练攻击者以更有效地引发不安全响应,更新防御者以识别这些不安全响应并解释不安全原因。实验结果表明,PAD 在发现有效攻击和建立稳健防护栏方面显著优于现有基线方法。此外,我们的发现表明,PAD 在在安全性和整体模型质量之间取得平衡方面表现出色。我们还揭示了在防护 LLM 方面的关键挑战,包括防御多轮攻击以及识别特定风险的需要更精妙策略。
引用
@article{arxiv.2407.01850,
title = {Purple-teaming LLMs with Adversarial Defender Training},
author = {Jingyan Zhou and Kun Li and Junan Li and Jiawen Kang and Minda Hu and Xixin Wu and Helen Meng},
journal= {arXiv preprint arXiv:2407.01850},
year = {2024}
}