中文

LR0.FM:低分辨率基准与面向基础模型的零样本分类鲁棒性提升

计算机视觉与模式识别 2025-05-20 v3

摘要

视觉语言基础模型(FMs)在 diverse 任务上表现出惊人的零样本泛化能力,这主要归因于在大规模数据集上进行的广泛预训练。然而,这些模型在低分辨率/像素化(LR)图像上的鲁棒性——这一现象在真实场景中较为常见——仍未得到充分探索。我们引入 LR0.FM,一个综合性基准,用于评估低分辨率对 10 个基础模型在 66 个背bone 和 15 个数据集上零样本分类性能的影响。我们提出了一种新型指标加权聚合鲁棒性(Weighted Aggregated Robustness),以克服现有指标的局限性,更好地评估模型在不同分辨率和数据集上的性能。我们的关键发现表明:(i)模型规模与分辨率退化的鲁棒性呈正相关,(ii)预训练数据集的质量比其规模更为重要,且(iii)微调和更高分辨率的模型对 LR 的鲁棒性较差。我们的分析进一步揭示,模型在 LR 上进行语义合理的预测,输入中细粒度细节的缺失对模型的初始层影响大于深层层。我们利用这些见解并提出一种简单策略 LR-TK0,用于在不损害预训练权重的前提下提升模型对低分辨率的鲁棒性。我们在多个数据集上演示了 LR-TK0 在低分辨率鲁棒性方面的有效性,并展示了其在不同 backbone 和其他方法上的泛化能力。代码已发布在 https://github.com/shyammarjit/LR0.FM

关键词

引用

@article{arxiv.2502.03950,
  title  = {LR0.FM: Low-Res Benchmark and Improving Robustness for Zero-Shot Classification in Foundation Models},
  author = {Priyank Pathak and Shyam Marjit and Shruti Vyas and Yogesh S Rawat},
  journal= {arXiv preprint arXiv:2502.03950},
  year   = {2025}
}

备注

Accepted to ICLR 2025