基于反馈的模态互搜:攻击视觉语言预训练模型的新方法
计算机视觉与模式识别
2024-09-12 v1 人工智能
机器学习
摘要
尽管视觉语言预训练(VLP)模型在跨模态任务上取得了显著进展,但仍然容易受到对抗攻击。当前主流的黑箱攻击方法是通过数据增强和跨模态交互,在代理模型上生成可迁移的对抗样本,因为这种方法在现实场景中更为实用。然而,由于不同模型在特征表示上的差异,这些方法的迁移性可能受到限制。为此,我们提出了一种新的攻击范式,称为基于反馈的模态互搜(FMMS)。FMMS引入一种新型模态互损失(MML),旨在将匹配的图像-文本对拉远,同时将不匹配的对随机拉近特征空间,从而引导对抗样本的更新方向。此外,FMMS利用目标模型的反馈迭代细化对抗样本,使其驶入对抗区域。据我们了解,这是首次利用目标模型反馈探索多模态对抗边界。在Flickr30K和MSCOCO数据集上进行的大量实证评估表明,FMMS在图像-文本匹配任务上显著优于现有SOTA基线方法。
引用
@article{arxiv.2409.06726,
title = {Feedback-based Modal Mutual Search for Attacking Vision-Language Pre-training Models},
author = {Renhua Ding and Xinze Zhang and Xiao Yang and Kun He},
journal= {arXiv preprint arXiv:2409.06726},
year = {2024}
}
备注
9 pages