中文

开放域视觉实体识别:面向数百万维基百科实体的识别

计算机视觉与模式识别 2023-02-27 v2 人工智能 计算与语言

摘要

CLIP 与 PaLI 等大规模多模态预训练模型在各种视觉域与任务上展现出强泛化能力。然而,现有图像分类基准常在特定域(如户外图像)或特定任务(如植物物种分类)上评估识别,不足以评测预训练基础模型是否为通用视觉识别器。为此,我们正式提出开放域视觉实体识别(Open-domain Visual Entity recognitioN, OVEN)任务,其中模型需将图像依据文本查询链接至一个维基百科实体。我们通过将 14 个现有数据集的所有标签 grounding 到单一标签空间——维基百科实体——来构建 OVEN-Wiki。OVEN 要求模型在六百万可能的维基百科实体中选择,使其成为标签数量最大的通用视觉识别基准。我们对最先进预训练模型的研究揭示了向海量标签空间泛化的巨大提升空间。我们表明基于 PaLI 的自回归视觉识别模型表现惊人地好,即便对微调期间从未见过的维基百科实体亦如此。我们还发现现有预训练模型各有优势:基于 PaLI 的模型总体性能更高,而基于 CLIP 的模型更擅长识别长尾实体。

关键词

引用

@article{arxiv.2302.11154,
  title  = {Open-domain Visual Entity Recognition: Towards Recognizing Millions of Wikipedia Entities},
  author = {Hexiang Hu and Yi Luan and Yang Chen and Urvashi Khandelwal and Mandar Joshi and Kenton Lee and Kristina Toutanova and Ming-Wei Chang},
  journal= {arXiv preprint arXiv:2302.11154},
  year   = {2023}
}

备注

Dataset available at https://open-vision-language.github.io/oven