视觉表征学习中的概念泛化
计算机视觉与模式识别
2021-09-13 v2 机器学习
摘要
衡量概念泛化,即训练于一组(已见)视觉概念上的模型在多大程度上可用于识别一组新的(未见)概念,是评估视觉表征的一种流行方法,尤其在自监督学习框架中。然而,此类评估中未见概念的选择通常是任意的,且与用于训练表征的已见概念相互独立,从而忽略了二者之间的任何语义关系。本文认为,已见与未见概念之间的语义关系会影响泛化性能,并提出了 ImageNet-CoG,一个基于 ImageNet-21K(IN-21K)数据集的新基准,能够以原则性方式衡量概念泛化。我们的基准利用来自 WordNet 的专家知识,定义了一系列语义上距离 ImageNet-1K(IN-1K)子集(一个无处不在的训练集)越来越远的未见 IN-21K 概念集。这使得我们能够直接对在 IN-1K 上学习的视觉表征进行基准测试。我们开展了一项涵盖 31 个卷积与基于 transformer 的模型的大规模研究,并展示了不同架构、监督程度、正则化技术以及网络数据的使用如何影响概念泛化性能。
引用
@article{arxiv.2012.05649,
title = {Concept Generalization in Visual Representation Learning},
author = {Mert Bulent Sariyildiz and Yannis Kalantidis and Diane Larlus and Karteek Alahari},
journal= {arXiv preprint arXiv:2012.05649},
year = {2021}
}
备注
Accepted to ICCV 2021. See our project website: https://europe.naverlabs.com/cog-benchmark for code and ImageNet-CoG level files