中文

面向通用视觉模型的网络监督概念扩展

计算机视觉与模式识别 2022-07-22 v2 计算与语言

摘要

通用视觉(GPV)系统是指无需改变架构即可解决大量视觉任务的模型。当前,GPV 主要从大规模全监督数据集中学习技能与概念。通过为每个技能获取每个概念的学习数据,将 GPV 扩展到上万概念很快变得难以承受。本文提出一种有效且低成本的替代方案:从监督数据集学习技能,从网络图像搜索学习概念,并利用 GPV 的一个关键特性——跨技能迁移视觉知识的能力。我们使用一个涵盖 10k+ 视觉概念、包含 1M+ 图像的数据集,在 3 个基准上展示了对两个现有 GPV(GPV-1 和 VL-T5)的网络监督概念扩展:5 个基于 COCO 的数据集(80 个主要概念)、一组新整理的基于 OpenImages 和 VisualGenome 仓库的 5 个数据集(约 500 个概念),以及网络衍生数据集(10k+ 概念)。我们还提出了一种新架构 GPV-2,支持多种任务——从分类与定位等视觉任务,到问答与描述等视觉+语言任务,再到人-物交互检测等更细分的任务。GPV-2 从网络数据中获益巨大,并在这些基准上优于 GPV-1 和 VL-T5。我们的数据、代码和网络演示可在 https://prior.allenai.org/projects/gpv2 获取。

关键词

引用

@article{arxiv.2202.02317,
  title  = {Webly Supervised Concept Expansion for General Purpose Vision Models},
  author = {Amita Kamath and Christopher Clark and Tanmay Gupta and Eric Kolve and Derek Hoiem and Aniruddha Kembhavi},
  journal= {arXiv preprint arXiv:2202.02317},
  year   = {2022}
}

备注

ECCV 2022