SLANT:虚假标志分析工具包
计算机视觉与模式识别
2024-06-04 v1
摘要
在线内容充斥着标志,从广告和社交媒体帖子到网站品牌和产品植入。因此,这些标志在用于预训练视觉-语言模型(VLM)的广泛网络抓取数据集中普遍存在,而VLM被用于各种任务(内容审核、对象分类)。尽管这些模型已被证明在各种任务中学习到有害的相关性,但这些相关性是否包括标志仍研究不足。理解这一点尤为重要,因为标志常被品牌和政府机构等面向公众的实体使用。为此,我们开发了SLANT:一个虚假标志分析工具包。我们的关键发现是,某些标志确实会导致虚假的错误预测,例如,将阿迪达斯标志添加到一个人的照片中会导致模型将该人分类为贪婪。SLANT包含一个半自动机制,用于挖掘此类“虚假”标志。该机制由一个全面的标志库CC12M-LogoBank和一个算法组成,该算法在库中搜索VLM与用户提供的下游识别目标虚假相关的标志。我们发现了各种看似无害的标志,VLM将其与1)负面人类形容词、2)“无害”概念相关联,导致模型将有害在线内容错误分类为无害,以及3)用户提供的对象概念相关联,导致ImageNet零样本分类的识别准确率降低。此外,SLANT的标志可被视为对基础模型的有效攻击;攻击者可以将虚假标志放在有害内容上,导致模型将其错误分类为无害。考虑到标志攻击的简单性,这种威胁令人担忧,增加了VLM的攻击面。作为防御,我们的工具包包含了两种有效的缓解策略,可与基础模型的零样本推理无缝集成。
引用
@article{arxiv.2406.01449,
title = {SLANT: Spurious Logo ANalysis Toolkit},
author = {Maan Qraitem and Piotr Teterwak and Kate Saenko and Bryan A. Plummer},
journal= {arXiv preprint arXiv:2406.01449},
year = {2024}
}