中文

训练数据如何驱动不安全图像生成:无安全剂量

计算机视觉与模式识别 2026-05-28 v1 机器学习

摘要

在大规模数据上训练的文本到图像模型常不可避免地摄取不安全内容。虽然有些人观察到输入-输出放大效应,但是否及如何直接驱动模型输出安全性或通过其他因素仍不清楚。我们通过隔离该变量来阐明这一问题:我们在多个数据集规模(100K 至 8M)上训练相同的文本到图像模型,使其数据集中不安全图像的比例从0%到9.6%。然后我们生成由这些模型生成的图像,并用四个独立的安全分类器进行评估。输出不安全性从0% 掺杂时16.6%单调上升至5%时25.5%。一个因子设计揭示,\emph{比例}而非绝对数量的不安全训练图像是起作用变量。在零掺杂下16.6%的不可约基线指向其他组件(如冻结文本编码器)作为残余安全风险——通过文本编码器消除实验证明 SafeCLIP 可将此底部降至9.6%,而剂量-反应效应在所有测试的三个编码器中仍然存在。关键的是,无论如何,FID、CLIPscore 和 ImageReward 等质量指标均未出现退化。这些结果表明数据治理和文本编码器安全是互补且独立有效的干预措施。同时,剩余的不安全水平对未来研究关于新兴能力和组合性提出了问题。

关键词

引用

@article{arxiv.2605.28137,
  title  = {No Safe Dose: How Training Data Drives Unsafe Image Generation},
  author = {Felix Friedrich and Lukas Helff and Niharika Hegde and Patrick Schramowski and Kristian Kersting},
  journal= {arXiv preprint arXiv:2605.28137},
  year   = {2026}
}