PRJ:生成图像的感知-检索-判断
计算机视觉与模式识别
2025-06-05 v1
摘要
生成式AI的快速发展带来了显著的创作能力,但也引发了关于AI生成视觉内容在现实世界应用(如内容审核、平台治理和数字媒体监管)中安全性的紧迫担忧。这包括色情图像、暴力场景、仇恨符号、宣传材料以及对受版权保护艺术作品的未经授权模仿等不安全内容。现有的图像安全系统通常依赖刚性类别过滤器并产生二元输出,缺乏解读上下文或推理细微的、 adversarially 诱导的损害形式的能力。此外,标准评估指标(如攻击成功率)无法捕捉毒性的语义严重性和动态进展。为解决这些局限性,我们提出了感知-检索-判断(PRJ),一种受认知启发的框架,将毒性检测建模为结构化推理过程。PRJ遵循三阶段设计:首先将图像转换为描述性语言(感知),然后检索与危害类别和特征相关的外部知识(检索),最后基于法律或规范规则评估毒性(判断)。这种以语言为中心的结构使系统能够以更高的可解释性和类别粒度检测显性和隐性危害。此外,我们引入了一种基于语境毒性风险矩阵的动态评分机制,用于量化不同语义维度上的危害程度。实验表明,PRJ在检测准确性和鲁棒性方面超越了现有的安全检查器,同时独特地支持结构化的类别级毒性解读。
引用
@article{arxiv.2506.03683,
title = {PRJ: Perception-Retrieval-Judgement for Generated Images},
author = {Qiang Fu and Zonglei Jing and Zonghao Ying and Xiaoqian Li},
journal= {arXiv preprint arXiv:2506.03683},
year = {2025}
}