通过视觉领域视角基准化全视觉表征
计算机视觉与模式识别
2022-07-18 v2
摘要
尽管在特定视觉领域(如人脸、狗和场景)已取得令人印象深刻的性能,但能泛化到许多自然视觉域的全视觉(omni-vision)表征仍极受期待。然而,现有基准存在偏差且效率低,无法评估全视觉表征——这些基准要么仅包含若干特定领域,要么以涵盖多数领域为代价而囊括大量领域重叠的数据集。本文提出全领域基准(Omni-Realm Benchmark,OmniBenchmark)。它包含 21 个领域级数据集,涵盖 7,372 个概念和 1,074,346 张图像。在无语义重叠下,这些数据集全面且高效地覆盖了大多数视觉领域。此外,我们提出一种新的监督对比学习框架,即关系对比学习(Relational Contrastive learning,ReCo),以获得更好的全视觉表征。除将同一概念的两个实例拉近——典型监督对比学习框架——外,ReCo 还将同一语义领域的两个实例拉近,编码概念间语义关系,促进全视觉表征学习。我们在 OmniBenchmark 上以不同架构(从 CNN 到 transformer)和学习范式(从监督学习到自监督学习)对 ReCo 及其他全视觉表征研究进展进行基准测试。我们展示了 ReCo 优于其他监督对比学习方法,并揭示了多个实用观察以助未来研究。
引用
@article{arxiv.2207.07106,
title = {Benchmarking Omni-Vision Representation through the Lens of Visual Realms},
author = {Yuanhan Zhang and Zhenfei Yin and Jing Shao and Ziwei Liu},
journal= {arXiv preprint arXiv:2207.07106},
year = {2022}
}
备注
In ECCV 2022; The project page at https://zhangyuanhan-ai.github.io/OmniBenchmark