中文

CaptionFool:通用图像描述模型攻击

计算机视觉与模式识别 2026-03-03 v1 人工智能

摘要

图像描述模型是基于大规模图像-文本数据集训练的编码器-解码器结构,易受到对抗攻击。我们提出 CaptionFool,这是一种针对基于变换器构建的先进图像描述模型的通用(输入不可知)对抗攻击。通过仅修改 577 张图像补丁中的 7 个(约 1.2%),我们的攻击在生成任意目标描述方面 achieves 94-96% 的成功率,包括包含歧视内容的描述。我们进一步演示 CaptionFool 可生成专为规避现有内容审查过滤器而设计的“俚语”术语。我们的发现揭示了部署式视觉语言模型的严重漏洞,凸显了针对此类攻击构建稳健防御的紧迫需求。警告:本文包含可能具有冒犯性的内容。

关键词

引用

@article{arxiv.2603.00529,
  title  = {CaptionFool: Universal Image Captioning Model Attacks},
  author = {Swapnil Parekh},
  journal= {arXiv preprint arXiv:2603.00529},
  year   = {2026}
}