ConvNet 对比 Transformer、有监督对比 CLIP:超越 ImageNet 准确率
计算机视觉与模式识别
2024-07-24 v3 机器学习
摘要
现代计算机视觉为从业者提供了多种多样的模型,而从多个选项中为特定应用挑选模型可能颇具挑战。传统上,相互竞争的模型架构与训练协议通过其在 ImageNet 上的分类准确率进行比较。然而,这一单一指标并未充分捕捉对专门任务至关重要的性能细微差别。在这项工作中,我们对 ConvNet 与 Vision Transformer 架构(各自涵盖有监督与 CLIP 训练范式)在 ImageNet 准确率之外的模型行为进行了深入比较分析。尽管我们选定的模型具有相似的 ImageNet 准确率与计算需求,我们发现它们在许多其他方面存在差异:错误类型、输出校准、可迁移性以及特征不变性等。这种未被传统指标捕捉的模型特性多样性,凸显了在选择不同模型时进行更细致分析的必要性。我们的代码可在 https://github.com/kirill-vish/Beyond-INet 获取。
引用
@article{arxiv.2311.09215,
title = {ConvNet vs Transformer, Supervised vs CLIP: Beyond ImageNet Accuracy},
author = {Kirill Vishniakov and Zhiqiang Shen and Zhuang Liu},
journal= {arXiv preprint arXiv:2311.09215},
year = {2024}
}
备注
Project page: https://kirill-vish.github.io/beyond-imagenet-accuracy/