中文

基于 MLLM 进行无需人工标注的图像安全评估

计算机视觉与模式识别 2025-04-08 v2 计算与语言 计算机与社会 机器学习

摘要

图像内容安全已成为日益突出的挑战,这源于视觉媒体在在线平台上的兴起。与此同时,在AI生成内容(AIGC)的时代,许多图像生成模型能够产生有害内容,例如包含色情或暴力 material 的图像。因此,基于既定安全规则识别此类不安全图像至关重要。预训练的多模态大语言模型(MLLM)因其强大的模式识别能力而潜在地可用于此任务。现有方法通常通过人工标注数据集进行微调,但这存在诸多缺点:首先,依赖人工标注者遵循复杂且详尽的指南进行数据标注既昂贵又费时。此外,面对需要频繁更新安全规则的用户,基于人工标注的微调变得更加困难。这引出了这样一个研究问题:我们能否通过在零样本设置下查询 MLLM 并使用预定义的安全宪法(一组安全规则)来检测不安全的图像?我们的研究表明,仅仅查询预训练 MLLM 并不 yield 令人满意的结果。这种缺乏效果性源于诸多因素,例如安全规则的主观性、宪法文本的复杂性以及模型固有的偏见。为解决这些挑战,我们提出了一种 MLLM 方法,包括客观化安全规则、评估规则与图像之间的相关性、基于去偏置 token 概率进行快速判断,以及在必要时采用级联链式思考过程进行更深入的推理。实验结果表明,我们的方法在零样本图像安全评估任务中效果极佳。

关键词

引用

@article{arxiv.2501.00192,
  title  = {MLLM-as-a-Judge for Image Safety without Human Labeling},
  author = {Zhenting Wang and Shuming Hu and Shiyu Zhao and Xiaowen Lin and Felix Juefei-Xu and Zhuowei Li and Ligong Han and Harihar Subramanyam and Li Chen and Jianfa Chen and Nan Jiang and Lingjuan Lyu and Shiqing Ma and Dimitris N. Metaxas and Ankit Jain},
  journal= {arXiv preprint arXiv:2501.00192},
  year   = {2025}
}