中文

TIMA:用于平衡零样态对抗鲁棒性与泛化能力的文本-图像相互感知

计算机视觉与模式识别 2024-05-29 v1 人工智能

摘要

本 work 旨在实现在保持零样态泛化能力的同时,提高大规模基础模型的零样态对抗鲁棒性,聚焦于流行的Contrastive Language-Image Pre-training (CLIP) 模型。虽然基础模型被报告显示出卓越的零样态泛化能力,但它们对对抗性扰动极其脆弱。现有方法在小扰动下能够实现较好的零样态对抗鲁棒性与泛化能力之间的折中,但在大扰动下无法实现良好的折中。为此,我们提出一种新颖的文本-图像相互感知(Text-Image Mutual Awareness, TIMA)方法,实现零样态对抗鲁棒性与泛化能力之间的平衡。更具体地,我们提出一种图像感知文本(Image-Aware Text, IAT)调优机制,通过包含最小球面能(Minimum Hyperspherical Energy, MHE)来增加文本嵌入的类别间距离。同时,使用固定的预训练图像嵌入作为跨模态辅助监督,通过知识蒸馏维持MHE调优后文本嵌入与原始文本嵌入之间的相似性,以保持不同类别之间的语义信息。此外,我们引入一种文本感知图像(Text-Aware Image, TAI)调优机制,通过基于文本距离的自适应间距(Text-distance based Adaptive Margin, TAM)在训练阶段增加图像嵌入的类别间距离。类似地,利用知识蒸馈保留精细调优后图像嵌入与预训练图像嵌入之间的相似性。大量实验结果表明,我们的方法有效,能够在广泛的对抗性扰动下实现卓越的零样态性能,同时保持原始CLIP模型的零样态泛化能力。

关键词

引用

@article{arxiv.2405.17678,
  title  = {TIMA: Text-Image Mutual Awareness for Balancing Zero-Shot Adversarial Robustness and Generalization Ability},
  author = {Fengji Ma and Li Liu and Hei Victor Cheng},
  journal= {arXiv preprint arXiv:2405.17678},
  year   = {2024}
}