中文

Moderator:通过细粒度上下文策略调控文本到图像扩散模型的内容审核

密码学与安全 2024-09-13 v2

摘要

我们提出 Moderator,一种基于策略的模型管理系统,允许管理员指定细粒度的内容审核策略,并修改文本到图像(TTI)模型的权重,使其显著更难生成违反策略的图像。与现有不考虑相关上下文的通用模型编辑技术不同,Moderator 允许管理员指定应审核的内容、审核的上下文、如何审核以及审核的必要性。给定一组策略后,Moderator 首先提示原始模型生成需要审核的图像,然后利用这些自生成图像对模型进行反向微调以计算审核任务向量,最后利用任务向量对原始模型取反,降低其生成被审核内容的能力。我们用 14 名参与者扮演管理员角色进行评估,发现他们可以在约 2.29 次策略迭代内快速学习并编写策略以通过单元测试。我们对 32 名 Stable Diffusion 用户的实验表明,Moderator 可以阻止 65% 的用户在 15 次尝试内生成被审核内容,并要求剩余用户平均多尝试 8.3 次才能生成不希望的内容。

关键词

引用

@article{arxiv.2408.07728,
  title  = {Moderator: Moderating Text-to-Image Diffusion Models through Fine-grained Context-based Policies},
  author = {Peiran Wang and Qiyu Li and Longxuan Yu and Ziyao Wang and Ang Li and Haojian Jin},
  journal= {arXiv preprint arXiv:2408.07728},
  year   = {2024}
}

备注

Accepted by ACM CCS 2024