多图像场景下的排版攻击
密码学与安全
2025-02-13 v1
摘要
大型视觉语言模型(LVLMs)容易受到排版攻击,即因添加到图像中的攻击文本而导致的错误分类。本文引入了多图像场景来研究排版攻击,拓宽了当前文献对攻击单张图像的关注。具体而言,我们聚焦于不重复攻击查询的图像集攻击。此类非重复攻击更为隐蔽,因为它们比重复相同攻击文本的攻击更有可能规避门禁。我们为多图像场景引入了两种攻击策略,利用目标图像的难度、攻击文本的强度以及文本-图像相似度。我们的文本-图像相似度方法在使用 ImageNet 的 CLIP 模型上,将攻击成功率相比随机非特定方法提高了 21%,同时在多图像场景下保持了隐蔽性。额外的实验展示了可迁移性,即利用 CLIP 计算的文本-图像相似度在攻击 InstructBLIP 时同样有效。
引用
@article{arxiv.2502.08193,
title = {Typographic Attacks in a Multi-Image Setting},
author = {Xiaomeng Wang and Zhengyu Zhao and Martha Larson},
journal= {arXiv preprint arXiv:2502.08193},
year = {2025}
}
备注
Accepted by NAACL2025. Our code is available at https://github.com/XiaomengWang-AI/Typographic-Attacks-in-a-Multi-Image-Setting