中文

通过基于规则的偏好建模对文本到图像系统进行红队测试

机器学习 2025-05-28 v1 人工智能 密码学与安全 计算机视觉与模式识别 机器学习

摘要

文本到图像(T2I)模型由于具有生成不当或有害图像的潜力,引发了伦理和安全担忧。通过红队测试评估这些模型的安全性至关重要,然而白盒方法因需要内部访问权限而受限,使其难以应用于闭源模型。此外,现有的黑盒方法通常假设了解模型特定的防御机制,限制了其在现实商业 API 场景中的实用性。一个重大挑战是如何规避未知且多样的防御机制。为克服这一困难,我们提出了一种新颖的基于规则的偏好建模引导红队测试(RPG-RT),该方法迭代地利用 LLM 修改提示词进行查询,并利用 T2I 系统的反馈微调 LLM。RPG-RT 将每次迭代的反馈作为先验,使 LLM 能够动态适应未知的防御机制。鉴于反馈通常是带标签且粗粒度的,难以直接利用,我们进一步提出了基于规则的偏好建模,该建模采用一组规则来评估期望或不期望的反馈,从而促进对 LLM 动态适应过程的更细粒度控制。在具有不同安全机制的十九个 T2I 系统、三个在线商业 API 服务以及 T2V 模型上的广泛实验验证了我们方法的优越性和实用性。

关键词

引用

@article{arxiv.2505.21074,
  title  = {Red-Teaming Text-to-Image Systems by Rule-based Preference Modeling},
  author = {Yichuan Cao and Yibo Miao and Xiao-Shan Gao and Yinpeng Dong},
  journal= {arXiv preprint arXiv:2505.21074},
  year   = {2025}
}