中文

利用多模态大语言模型进行鲁棒图像分类

计算机视觉与模式识别 2025-04-21 v2 密码学与安全 机器学习

摘要

深度神经网络容易受到对抗样本的攻击,即精心构造的输入样本能导致模型以高置信度做出错误预测。为了缓解这些脆弱性,研究者提出了对抗训练和基于检测的防御方法来提前增强模型。然而,这些方法大多只关注单一数据模态,忽略了输入的视觉模式与文本描述之间的关系。在本文中,我们提出了一种新型防御方法 MultiShield,旨在将多模态信息与这些防御方法相结合并形成互补,以进一步增强其鲁棒性。MultiShield 利用多模态大语言模型检测对抗样本,并在输入的文本与视觉表征不一致时拒绝不确定的分类。在使用鲁棒和非鲁棒图像分类模型对 CIFAR-10 和 ImageNet 数据集进行的广泛评估中,结果表明 MultiShield 能够轻松集成以检测并拒绝对抗样本,性能优于原始防御方法。

关键词

引用

@article{arxiv.2412.10353,
  title  = {Robust image classification with multi-modal large language models},
  author = {Francesco Villani and Igor Maljkovic and Dario Lazzaro and Angelo Sotgiu and Antonio Emanuele Cinà and Fabio Roli},
  journal= {arXiv preprint arXiv:2412.10353},
  year   = {2025}
}

备注

Paper accepted at Pattern Recognition Letters journal Keywords: adversarial examples, rejection defense, multimodal-informed systems, machine learning security