面向常见扰动的视觉基础模型鲁棒性研究
密码学与安全
2026-04-17 v1 计算机视觉与模式识别
摘要
视觉基础模型会输出图像的嵌入向量,这些向量可能受到常见编辑操作(如 JPEG 压缩、亮度、对比度调整)的影响。这些常见扰动会改变嵌入向量,可能影响使用这些嵌入向量的下游任务性能。本文首次系统性研究了基础模型对此类扰动的鲁棒性。我们提出了三个鲁棒性指标,并为这些指标设定了五个理想数学性质,分析哪些性质被满足或被违反。使用这些指标,我们评估了六个行业规模的基础模型(OpenAI、Meta),覆盖九种常见扰动类别,发现其普遍不具鲁棒性。我们还表明常见扰动会降低下游应用性能(如分类准确率),且鲁棒性值可预测性能影响。最后,我们提出一种微调方法以提升鲁棒性而不牺牲实用性。
引用
@article{arxiv.2604.14973,
title = {Robustness of Vision Foundation Models to Common Perturbations},
author = {Hongbin Liu and Zhengyuan Jiang and Cheng Hong and Neil Zhenqiang Gong},
journal= {arXiv preprint arXiv:2604.14973},
year = {2026}
}
备注
Accepted by CVPR 2026 Workshop