中文

ART: 用于保护良性用户的文本到图像模型的自动红队测试

密码学与安全 2024-10-14 v3 人工智能

摘要

大规模预训练生成模型因其生成创意内容的能力而风靡全球。同时,为了保护用户的权利和安全,针对这些生成模型开发了安全措施,其中大部分是针对大型语言模型设计的。现有方法主要关注越狱和对抗性攻击,这些方法主要评估模型在恶意提示下的安全性。最近的研究发现,手动构造的安全提示可能无意中触发不安全的内容生成。为了进一步系统地评估文本到图像模型的安全风险,我们提出了一种新颖的自动红队框架ART。我们的方法利用视觉语言模型和大型语言模型建立不安全生成与其提示之间的联系,从而更有效地识别模型的漏洞。通过全面的实验,我们揭示了流行的开源文本到图像模型的毒性。实验还验证了ART的有效性、适应性和多样性。此外,我们引入了三个大规模的红队数据集,用于研究文本到图像模型相关的安全风险。数据集和模型可在https://github.com/GuanlinLee/ART找到。

关键词

引用

@article{arxiv.2405.19360,
  title  = {ART: Automatic Red-teaming for Text-to-Image Models to Protect Benign Users},
  author = {Guanlin Li and Kangjie Chen and Shudong Zhang and Jie Zhang and Tianwei Zhang},
  journal= {arXiv preprint arXiv:2405.19360},
  year   = {2024}
}

备注

Accepted by NeurIPS 2024