中文

别让它滞后,RAG:基于 RAG 的训练-free 对抗性检测

人工智能 2025-07-31 v3 机器学习

摘要

对抗性补丁攻击是一种威胁视觉系统的主要因素,通过嵌入局部扰动来误导深度模型。传统防御方法通常需要重新训练或微调,使其难以在实际部署中实用。我们提出了一种训练-free 视觉检索增强生成(VRAG)框架,将视觉语言模型(VLM)用于对抗性补丁检测。通过检索与存储的攻击类似的视觉补丁和图像,VRAG进行生成式推理以识别多样化的攻击类型,无需额外训练或微调。我们广泛评估了开源大型VLM,包括Qwen-VL-Plus、Qwen2.5-VL-72B和UI-TARS-72B-DPO,以及Gemini-2.0这一闭源模型。值得注意的是,开源模型UI-TARS-72B-DPO实现了最高可达95%的分类准确率,为开源对抗性补丁检测树立了新的国家级最佳成绩。Gemini-2.0达到了最高的整体准确率98%,但 remains 闭源。实验结果表明,VRAG在识别多种对抗性补丁方面效果出色,仅需少量人工标注,为抵御不断演变的对抗性补丁攻击铺平了稳健、实用的防御之路。

关键词

引用

@article{arxiv.2504.04858,
  title  = {Don't Lag, RAG: Training-Free Adversarial Detection Using RAG},
  author = {Roie Kazoom and Raz Lapid and Moshe Sipper and Ofer Hadar},
  journal= {arXiv preprint arXiv:2504.04858},
  year   = {2025}
}

备注

Accepted at VecDB @ ICML 2025