中文

T2ISafety:用于评估图像生成中公平性、毒性与隐私的基准

计算与语言 2025-07-28 v3 密码学与安全

摘要

文本到图像 (T2I) 模型快速发展,使其能够在 various 领域从文本提示生成高质量图像。然而,这些模型还存在显著的安全问题,包括生成有害、偏置或私人内容的风险。当前对 T2I 安全评估的研究仍处于早期阶段。虽然已有一些努力尝试在特定安全维度上评估模型,但许多关键风险仍未被探索。为弥合这一差距,我们引入 T2ISafety,一个覆盖毒性、公平性和偏置三个关键领域的安全基准。我们构建了一个包含 12 个任务和 44 个类别的详细层次结构,精心收集了 70K 条相应提示。基于该分类学和提示集,我们构建了一个规模为 68K 张的大型 T2I 数据集,进行了 68K 张人工标注图像,并训练了一个能够检测以往工作未能识别的关键风险的评估器,甚至包括即使是超大型专有模型如 GPT 也无法正确检测的风险。我们对 12 个突出扩散模型在 T2ISafety 上的进行评估,揭示了包括但不限于种族公平性持续存在问题、倾向于生成有毒内容以及即使在概念抹除等防御方法下,模型之间在隐私保护方差也很大的诸多关切。数据和评估器已在 https://github.com/adwardlee/t2i_safety 上发布。

关键词

引用

@article{arxiv.2501.12612,
  title  = {T2ISafety: Benchmark for Assessing Fairness, Toxicity, and Privacy in Image Generation},
  author = {Lijun Li and Zhelun Shi and Xuhao Hu and Bowen Dong and Yiran Qin and Xihui Liu and Lu Sheng and Jing Shao},
  journal= {arXiv preprint arXiv:2501.12612},
  year   = {2025}
}

备注

Accepted at CVPR 2025