中文

语言驱动锚点实现零样本对抗鲁棒性

计算机视觉与模式识别 2024-03-12 v3 人工智能 机器学习

摘要

深度神经网络(DNNs)已知易受对抗攻击。以往研究主要关注在全监督设定下提升对抗鲁棒性,令零样本对抗鲁棒性这一具挑战性的领域仍悬而未决。本工作中,我们借助如 CLIP 等大型视觉-语言模型的最新进展,利用其为 DNNs 引入零样本对抗鲁棒性。我们提出 LAAT,一种语言驱动、基于锚点的对抗训练策略。LAAT 将每个类别的文本编码器特征用作各类别的固定锚点(归一化特征嵌入),随后用于对抗训练。通过利用文本编码器的语义一致性,LAAT 旨在增强图像模型在新类别上的对抗鲁棒性。然而,朴素地使用文本编码器会导致较差结果。经分析,我们将问题归因为文本编码器间的高余弦相似度。继而我们设计了一种扩展算法与对齐交叉熵损失来缓解该问题。实验结果表明,LAAT 相较最先进方法显著提升了零样本对抗鲁棒性。LAAT 有潜力通过大规模多模态模型增强对抗鲁棒性,尤其在训练期间无标注数据可用时。

关键词

引用

@article{arxiv.2301.13096,
  title  = {Language-Driven Anchors for Zero-Shot Adversarial Robustness},
  author = {Xiao Li and Wei Zhang and Yining Liu and Zhanhao Hu and Bo Zhang and Xiaolin Hu},
  journal= {arXiv preprint arXiv:2301.13096},
  year   = {2024}
}

备注

Accepted by CVPR 2024