文本引导注意力:视觉-语言模型零样本鲁棒性的关键
计算机视觉与模式识别
2024-10-31 v2 人工智能
摘要
由于出色的零样本能力,预训练的视觉-语言模型(例如 CLIP)在各个领域引起了广泛关注并被采用。尽管如此,CLIP 已被观察到容易受到对抗样本的攻击。通过实验分析,我们观察到一种现象,即对抗性扰动会诱导文本引导注意力的偏移。基于这一观察,我们提出了一种简单而有效的策略:面向零样本鲁棒性的文本引导注意力(TGA-ZSR)。该框架包含两个组件:注意力细化模块和基于注意力的模型约束模块。我们的目标是保持 CLIP 模型的泛化能力并增强其对抗鲁棒性:注意力细化模块将通过对抗样本从目标模型获得的文本引导注意力与通过干净样本从原始模型获得的文本引导注意力对齐。这种对齐增强了模型的鲁棒性。此外,基于注意力的模型约束模块使用干净样本从目标模型和原始模型获取文本引导注意力。其目标是在保持模型在干净样本上性能的同时增强整体鲁棒性。实验验证,我们的方法在 16 个数据集上的零样本鲁棒准确率比当前最先进技术提升了 9.58%。我们的代码可在 https://github.com/zhyblue424/TGA-ZSR 获取。
引用
@article{arxiv.2410.21802,
title = {Text-Guided Attention is All You Need for Zero-Shot Robustness in Vision-Language Models},
author = {Lu Yu and Haiyang Zhang and Changsheng Xu},
journal= {arXiv preprint arXiv:2410.21802},
year = {2024}
}
备注
Accepted by NeurIPS 2024