一种面向 Wikipedia 规模视觉实体识别的生成式方法
计算机视觉与模式识别
2024-03-22 v2
摘要
本文研究网络规模的视觉实体识别,具体而言,即将给定查询图像映射到 Wikipedia 中 600 万个现有实体之一的任务。处理此类规模问题的一种方法是使用双编码器模型(例如 CLIP),将所有实体名称和查询图像嵌入到一个统一空间中,从而为近似 k-NN 搜索铺平道路。另一种方法是改造图像描述模型,直接为给定图像生成实体名称。与此相反,我们引入了一种新颖的生成式实体识别(GER)框架,该框架针对输入图像学习自回归地解码出标识目标实体的语义且具区分度的“代码”。我们的实验证明了这一 GER 范式的有效性,展示了在极具挑战性的 OVEN 基准上的 SOTA 性能。GER 超越了强大的图像描述、双编码器、视觉匹配和层次分类基线,证实了其在应对网络规模识别复杂性方面的优势。
引用
@article{arxiv.2403.02041,
title = {A Generative Approach for Wikipedia-Scale Visual Entity Recognition},
author = {Mathilde Caron and Ahmet Iscen and Alireza Fathi and Cordelia Schmid},
journal= {arXiv preprint arXiv:2403.02041},
year = {2024}
}
备注
CVPR2024