中文

ImageNet 训练的模型是否学习了捷径?频率捷径对泛化的影响

计算机视觉与模式识别 2025-03-25 v2

摘要

频率捷径是指模型严重依赖以进行正确分类的特定频率模式。先前的研究表明,在小图像数据集上训练的模型经常利用此类捷径,这可能损害其泛化性能。然而,识别频率捷径的现有方法需要昂贵的计算,并且对于分析在大规模数据集上训练的模型变得不切实际。在这项工作中,我们提出了第一个能够更高效地在大规模上分析频率捷径的方法。我们表明,CNN 和 Transformer 模型都在 ImageNet 上学习了频率捷径。我们还揭示,频率捷径解在很大程度上保留纹理信息的分布外(OOD)测试集上可以获得良好性能。然而,这些主要与纹理模式对齐的捷径阻碍了模型在基于渲染的 OOD 测试集上的泛化。这些观察表明,当前的 OOD 评估往往忽视了频率捷径对模型泛化的影响。未来的基准测试因此可以受益于明确评估和考虑这些捷径,以构建能够在更广泛的 OOD 场景中泛化的模型。

关键词

引用

@article{arxiv.2503.03519,
  title  = {Do ImageNet-trained models learn shortcuts? The impact of frequency shortcuts on generalization},
  author = {Shunxin Wang and Raymond Veldhuis and Nicola Strisciuglio},
  journal= {arXiv preprint arXiv:2503.03519},
  year   = {2025}
}

备注

received at CVPR2025