中文

当前最优视觉模型对自然变化的鲁棒性极限

计算机视觉与模式识别 2022-10-26 v1 机器学习

摘要

近期的最先进(state-of-the-art, SoTA)视觉模型引入了新架构、学习范式和更大的预训练数据,在分类等任务上取得了令人印象深刻的性能。尽管前几代视觉模型已被证明缺乏对姿态等因素的鲁棒性,但尚不清楚这一代模型在多大程度上更加鲁棒。为研究该问题,我们构建了一个包含超过 700 万张图像的数据集,对姿态、位置、背景、光照和尺寸进行受控变化。我们不仅研究了近期最先进模型的鲁棒程度,还研究了当这些因素在训练中出现时模型对因素变化的泛化能力。我们考虑了一系列近期视觉模型,包括视觉Transformer(ViT)、以掩码自编码器(MAE)为代表的自监督模型,以及基于更大数据集(如CLIP)训练的模型。我们发现,即使用今日的顶级模型,在未经调优的情况下也对姿态、尺寸和背景的常见变化缺乏鲁棒性。当训练中存在部分样本变化时,我们发现模型需要相当大比例的多样性才能泛化——尽管鲁棒性最终确实有所提升。然而,当多样性仅见于部分类别时,我们发现模型无法泛化到其他类别,除非这些类别与训练中所见变化类别非常相似。我们希望我们的工作能进一步揭示SoTA模型的盲区,并推动更鲁棒视觉模型的发展。

关键词

引用

@article{arxiv.2210.13604,
  title  = {The Robustness Limits of SoTA Vision Models to Natural Variation},
  author = {Mark Ibrahim and Quentin Garrido and Ari Morcos and Diane Bouchacourt},
  journal= {arXiv preprint arXiv:2210.13604},
  year   = {2022}
}