理解 CLIP 对图像压缩的脆弱性
计算机视觉与模式识别
2023-11-27 v1 机器学习
摘要
CLIP 是一种被广泛使用的基础视觉-语言模型,用于零样本图像识别及其他图像-文本对齐任务。我们证明 CLIP 对压缩下图像质量的变化是脆弱的。这一令人惊讶的结果进一步使用归因方法——积分梯度(Integrated Gradients)进行分析。借助该归因方法,我们能够从定量与定性上更好地理解压缩影响该模型零样本识别精度的具体性质。我们在 CIFAR-10 与 STL-10 上进行了广泛评估。我们的工作为理解 CLIP 的这一脆弱性提供了基础,并有助于我们开发更有效的方法来提升 CLIP 及其他视觉-语言模型的鲁棒性。
引用
@article{arxiv.2311.14029,
title = {Understanding the Vulnerability of CLIP to Image Compression},
author = {Cangxiong Chen and Vinay P. Namboodiri and Julian Padget},
journal= {arXiv preprint arXiv:2311.14029},
year = {2023}
}
备注
R0-FoMo: Workshop on Robustness of Few-shot and Zero-shot Learning in Foundation Models at NeurIPS 2023