中文

图像保护:基于条件视觉语言模型的推理与对不安全内容的反事实混淆

计算机视觉与模式识别 2024-01-23 v1

摘要

恶意行为者越来越多地利用社交媒体平台分享不安全内容,例如描绘性行为、网络欺凌和自残的图像。因此,主要平台使用人工智能(AI)和人工审核来混淆此类图像以使其更安全。混淆不安全图像的两个关键需求是:必须提供混淆图像区域的准确理由,并且为了用户的安全应对敏感区域进行混淆(例如模糊)。此过程涉及解决两个关键问题:(1)混淆不安全图像的理由要求平台提供准确的依据,且该依据必须基于不安全图像的特定属性;(2)图像中的不安全区域必须被最小程度地混淆,同时仍能展示安全区域。在这项工作中,我们通过以下方式解决这些关键问题:首先,通过设计一个以预训练不安全图像分类器为条件的视觉推理模型(VLM)来进行视觉推理,以提供基于不安全图像属性的准确依据;然后,提出一种反事实解释算法,通过最小化识别和混淆不安全区域以供安全浏览。该算法首先利用不安全图像分类器归因矩阵引导分割,以实现更优的子区域分割,随后进行知情的贪婪搜索,根据归因分数确定改变分类器输出所需的最少子区域数量。在来自社交网络的未整理数据上的大量实验强调了我们提出方法的有效性。我们在以下网址公开了我们的代码:https://github.com/SecureAIAutonomyLab/ConditionalVLM

关键词

引用

@article{arxiv.2401.11035,
  title  = {Image Safeguarding: Reasoning with Conditional Vision Language Model and Obfuscating Unsafe Content Counterfactually},
  author = {Mazal Bethany and Brandon Wherry and Nishant Vishwamitra and Peyman Najafirad},
  journal= {arXiv preprint arXiv:2401.11035},
  year   = {2024}
}