中文

面向多模态基础模型的实际手写字体韧性评估基准 SCAM

计算机视觉与模式识别 2026-03-19 v7 人工智能

摘要

手写体攻击利用文本与视觉内容之间的相互作用,在图像中嵌入误导性文本以导致多模态基础模型发生误分类。现有数据集规模有限且样本多样性差,难以研究此类漏洞。本文引入 SCAM 数据集,目前规模最大、样本最丰富的真实世界手写体攻击图像数据集,包含 1162 张图像,覆盖数百个目标物品类别和攻击词汇。通过对视觉语言模型在 SCAM 上的广泛基准测试,我们展示手写体攻击显著降低模型性能,并指出训练数据和模型架构会影响模型对此类攻击的易感性。我们的发现表明,手写体攻击仍对主流大型视觉语言模型有效,尤其是那些内置视觉编码器易受此类攻击影响的模型。然而,采用更大规模的大型语言模型作为底层架构可降低此类易感性,同时提升手写体理解能力。此外,我们证明合成攻击与真实世界(手写)攻击高度相似,验证了其在研究中的可行性。本工作提供了全面的资源和实证性洞见,以促进面向稳健可信赖的多模态人工智能系统的后续研究。最终,我们在 www.bliss.berlin/research/scam 公开发布本文引入的数据集及评估代码。

关键词

引用

@article{arxiv.2504.04893,
  title  = {SCAM: A Real-World Typographic Robustness Evaluation for Multimodal Foundation Models},
  author = {Justus Westerhoff and Erblina Purelku and Jakob Hackstein and Jonas Loos and Leo Pinetzki and Erik Rodner and Lorenz Hufe},
  journal= {arXiv preprint arXiv:2504.04893},
  year   = {2026}
}

备注

Accepted at CVPR 2025 Workshop EVAL-FoMo-2