双域鲁棒性:CLIP需要稳健的文本编码器
机器学习
2025-10-13 v2 人工智能
计算机视觉与模式识别
摘要
对抗性输入攻击会导致CLIP嵌入发生显著偏移。这会影响包含CLIP的管道中下游模型的鲁棒性,例如文本到图像生成模型或大型视觉语言模型。虽然已有一些努力旨在使CLIP图像编码器更具鲁棒性,但文本编码器的鲁棒性尚未得到探索。本文填补了这一文献空白。我们提出了LEAF:一种高效的文本领域对抗微调方法,能够扩展到大型CLIP模型。我们的模型在文本领域显著提高了零样例对抗准确率,同时保持由稳健图像编码器提供的视觉性能。当与文本到图像扩散模型结合时,我们可以在对抗噪声下提高生成质量。在多模态检索任务中,LEAF在标准CLIP模型的对抗噪声下显著提高了召回率。最后,我们表明,稳健文本编码器有助于通过直接优化从其嵌入重建输入文本。我们开源了代码(https://github.com/LIONS-EPFL/LEAF)和模型(https://huggingface.co/LEAF-CLIP)。
引用
@article{arxiv.2506.03355,
title = {Robustness in Both Domains: CLIP Needs a Robust Text Encoder},
author = {Elias Abad Rocamora and Christian Schlarmann and Naman Deep Singh and Yongtao Wu and Matthias Hein and Volkan Cevher},
journal= {arXiv preprint arXiv:2506.03355},
year = {2025}
}
备注
Accepted in NeurIPS 2025