中文

用于鲁棒红队测试与安全调优的大语言模型多样化攻击学习

计算与语言 2025-03-03 v2 密码学与安全 机器学习

摘要

红队测试或识别能够引发有害响应的提示词,是确保大语言模型(LLM)安全负责任部署的关键步骤。开发有效的防御措施以应对许多攻击提示模式,需要发现多样化的攻击。自动化红队测试通常使用强化学习来微调攻击者语言模型,以生成能引发目标LLM不希望得到的响应的提示词,例如通过辅助毒性分类器进行衡量。我们展示,即使具有明确的正则化以鼓励新颖性和多样性,现有方法仍会出现模式坍缩或未能生成有效攻击。作为一种灵活且概率上严谨的替代方案,我们提出使用GFlowNet微调,随后进行二次平滑阶段,以训练攻击者模型生成多样且有效的攻击提示。我们发现,我们的方法生成的攻击对广泛的目标LLM都有效,无论是否进行了安全调优,并且在目标LLM之间能够良好迁移。最后,我们展示了使用我们方法生成的红队测试提示词数据集进行安全调优的模型,对来自其他基于RL的红队测试方法的攻击具有鲁棒性。

关键词

引用

@article{arxiv.2405.18540,
  title  = {Learning diverse attacks on large language models for robust red-teaming and safety tuning},
  author = {Seanie Lee and Minsu Kim and Lynn Cherif and David Dobre and Juho Lee and Sung Ju Hwang and Kenji Kawaguchi and Gauthier Gidel and Yoshua Bengio and Nikolay Malkin and Moksh Jain},
  journal= {arXiv preprint arXiv:2405.18540},
  year   = {2025}
}

备注

ICLR 2025