评估文本到图像模型中概念过滤防御措施对儿童性虐待物质生成的影响
密码学与安全
2026-04-27 v2
摘要
我们评估了从训练数据集中过滤儿童图像以防止模型滥用生成儿童性虐待物质(CSAM)的有效性。首先,我们捕获了防止 CSAM 生成的复杂性,并提出基于游戏的安全定义。其次,我们表明当前检测方法无法完全移除数据集中的儿童。第三,我们使用儿童佩戴护镜作为 CSAM 的伦理代理,表明即使在过滤后仅保留少量儿童图像,仍存在可提示策略可仅通过少量于使用未过滤数据训练的模型所需查询次数更多查询即可生成佩戴护镜的儿童。进一步对过滤后模型进行儿童图像微调可进一步降低额外查询开销。我们还表明,即使过滤完美,重新引入概念也可能通过微调实现。我们的结果表明,当前的儿童过滤方法对封闭权重模型提供有限的保护,对开放权重模型提供没有保护的同时,通过阻碍生成儿童相关概念或改变其表征来降低模型的通用性。我们结论性地概述了在为 CSAM 概念过滤防御建立稳健证据方面的挑战。
引用
@article{arxiv.2512.05707,
title = {Evaluating Concept Filtering Defenses against Child Sexual Abuse Material Generation by Text-to-Image Models},
author = {Ana-Maria Cretu and Klim Kireev and Amro Abdalla and Wisdom Obinna and Raphael Meier and Sarah Adel Bargal and Elissa M. Redmiles and Carmela Troncoso},
journal= {arXiv preprint arXiv:2512.05707},
year = {2026}
}
备注
Extended version of the paper with the name published in the Proceedings of the 47th IEEE Symposium on Security & Privacy (IEEE S&P 2026). Please cite accordingly