中文

物体识别基准上的进展能否改善真实世界泛化能力?

计算机视觉与模式识别 2023-07-26 v1 机器学习

摘要

十多年来,研究者一直在基于 ImageNet 的泛化基准(如 ImageNet-A、-C 和 -R)上衡量物体识别的进展。在数量级更大数据上训练的基础模型近期进展已开始使这些标准基准饱和,但在实践中仍显脆弱。这表明倾向于关注预定义或合成变化的标准基准,可能不足以衡量真实世界泛化。因此,我们提议将跨地理的泛化作为衡量进展的更现实指标,使用来自全球家庭的两个物体数据集。我们对近 100 个视觉模型(直至最近的基础模型)的进展进行了广泛实证评估。我们首先确定了标准基准与真实世界地理偏移之间的进展鸿沟:ImageNet 上的进展在标准泛化基准上带来的进展是真实世界分布偏移上的至多 2.5 倍。其次,我们通过衡量各地区间性能差异(一种更细粒度的真实世界泛化度量)来研究模型的跨地理泛化。我们观察到所有模型都存在巨大的地理差异,即便是基础 CLIP 模型,地区间准确率差异也达 7-20%。与现代直觉相反,我们发现标准基准上的进展未能改善地理差异,反而常加剧之:表现最差模型与当今最佳模型之间的地理差异已扩大逾三倍。我们的结果表明,仅靠规模扩展不足以实现对真实世界分布偏移的一致鲁棒性。最后,我们在早期实验中强调,在更具代表性、经筛选的数据上进行简单的最后一层重训练,可作为补充规模扩展的有前景未来方向,将两基准上的地理差异均降低逾三分之二。

关键词

引用

@article{arxiv.2307.13136,
  title  = {Does Progress On Object Recognition Benchmarks Improve Real-World Generalization?},
  author = {Megan Richards and Polina Kirichenko and Diane Bouchacourt and Mark Ibrahim},
  journal= {arXiv preprint arXiv:2307.13136},
  year   = {2023}
}