中文

基于利用一对多关系的多模态对抗防御策略

计算机视觉与模式识别 2026-01-06 v6 人工智能 信息检索

摘要

预训练的视觉语言(VL)模型对对抗攻击极其脆弱。然而,现有的防御方法主要关注图像分类,忽略了 VL 任务的两个关键方面:多模态攻击,即图像和文本都可以被扰动;以及图像和文本的一对多关系,即单个图像可对应多个文本描述,反之亦然(1:N 和 N:1)。本文首次探索针对 VL 任务中多模态攻击的防御策略,而先前的 VL 防御方法仅关注视觉鲁棒性。我们提出多模态对抗训练(MAT),在训练期间在图像和文本两个模态上 Incorporate 对抗扰动,显著优于现有的单模态防御方法。此外,我们发现 MAT 受限于 VL 训练数据中确定性的一对一(1:1)图像-文本对。为解决这一问题,我们对利用一对多关系来增强鲁棒性进行了全面研究,探讨了多样化的增强技术。我们的分析表明,对于更有效的防御,增强后的图像-文本对应当在对齐、多样性和避免分布迁移之间取得平衡——这些条件被先前研究忽略。本工作首次提出针对多模态攻击的防御策略,从优化和数据两个角度为构建鲁棒 VL 模型提供了见解。我们的代码已公开于 https://github.com/CyberAgentAILab/multimodal-adversarial-training。

关键词

引用

@article{arxiv.2405.18770,
  title  = {Multimodal Adversarial Defense for Vision-Language Models by Leveraging One-To-Many Relationships},
  author = {Futa Waseda and Antonio Tejero-de-Pablos and Isao Echizen},
  journal= {arXiv preprint arXiv:2405.18770},
  year   = {2026}
}

备注

WACV 2026 Accepted. Code available at https://github.com/CyberAgentAILab/multimodal-adversarial-training