平凡中之仇恨:调控AI生成仇恨幻象的风险
密码学与安全
2025-07-31 v1 计算机视觉与模式识别
摘要
最新进展使文本到图像扩散模型能够创造一种新的数字艺术形式:光学错觉——视觉技巧,可创建不同的现实感知。然而,敌对者可能滥用此类技术生成仇恨幻象,将特定仇恨信息嵌入无害场景中,并在网络社区中传播。本文致力于探讨大规模仇恨幻象生成的风险及其可能绕过现有内容 moderation 模型的潜力。具体而言,我们使用 Stable Diffusion 和 ControlNet,在 62 条仇恨信息的条件下生成了 1,860 个光学错觉,其中 1,571 个为成功嵌入仇恨信息的仇恨幻象,构成了 Hateful Illusion 数据集。使用该数据集,我们评估了六个 moderation 分类器和九个视觉语言模型(VLM)识别仇恨幻象的表现。实验结果揭示了现有 moderation 模型的重大漏洞:分类器的检测准确率不足 0.245,VLM 的准确率不足 0.102。我们进一步识别出其视觉编码器的关键局限——其主要关注表层图像细节,忽略了次要层次信息,即隐藏信息。为应对此风险,我们探索了初步的缓解措施,从图像转换和训练层面识别了最有效的方法。
引用
@article{arxiv.2507.22617,
title = {Hate in Plain Sight: On the Risks of Moderating AI-Generated Hateful Illusions},
author = {Yiting Qu and Ziqing Yang and Yihan Ma and Michael Backes and Savvas Zannettou and Yang Zhang},
journal= {arXiv preprint arXiv:2507.22617},
year = {2025}
}
备注
Accepted at ICCV 2025