中文

FLIRT:反馈回路上下文内红队测试

人工智能 2024-11-11 v2

摘要

警告:本文包含可能不适当或冒犯的内容。随着生成模型在各种应用中供公众使用,测试和分析这些模型的漏洞已成为优先事项。在本工作中,我们提出一种自动红队测试框架,用于评估给定的黑盒模型并暴露其在生成不安全及不适当内容方面的漏洞。我们的框架在反馈回路中使用上下文学习来进行模型红队测试并触发其生成不安全内容。具体而言,以文本到图像模型作为目标模型,我们探索不同的反馈机制来自动学习有效且多样的对抗性提示。我们的实验表明,即使具备增强的安全特性,Stable Diffusion(SD)模型仍易受我们的对抗性提示攻击,引发对其实际使用中鲁棒性的担忧。此外,我们证明了所提框架对红队测试文本到文本模型同样有效。

关键词

引用

@article{arxiv.2308.04265,
  title  = {FLIRT: Feedback Loop In-context Red Teaming},
  author = {Ninareh Mehrabi and Palash Goyal and Christophe Dupuy and Qian Hu and Shalini Ghosh and Richard Zemel and Kai-Wei Chang and Aram Galstyan and Rahul Gupta},
  journal= {arXiv preprint arXiv:2308.04265},
  year   = {2024}
}

备注

EMNLP 2024