中文

基于语言模型的语义引导性对抗性测试

计算机视觉与模式识别 2025-08-18 v1 密码学与安全 机器学习

摘要

在针对视觉模型的有针对性的对抗攻击中,目标标签的选择是一个关键且常被忽视的因素,其决定了攻击成功率。当前策略通常依赖随机性、模型预测或静态语义资源,限制了可解释性、可重复性或灵活性。本文提出了一种基于语义引导的框架,用于利用预训练语言模型和视觉语言模型之间的跨模态知识迁移进行对抗性目标选择。我们评估了多个最新模型(BERT、TinyLLAMA 和 CLIP)作为相似性来源,用于选择与真实标签最相关和最不相关的标签,形成最佳和最差情况的对抗场景。我们的实验在三个视觉模型和五种攻击方法上揭示,这些模型一致地提供了实用的对抗目标,并优于静态词典资源(如 WordNet),特别是在距离较远的类别关系方面。我们还观察到静态测试目标标签提供了相似性来源有效性的初步评估,先于测试。我们的结果证实了预训练模型适用于构建可解释、标准化和可扩展的对抗基准测试的事实,这些基准测试跨越各种体系结构和数据集。

关键词

引用

@article{arxiv.2508.11341,
  title  = {Semantically Guided Adversarial Testing of Vision Models Using Language Models},
  author = {Katarzyna Filus and Jorge M. Cruz-Duarte},
  journal= {arXiv preprint arXiv:2508.11341},
  year   = {2025}
}

备注

12 pages, 4 figures, 3 tables. Submitted for peer review