中文

WikiCLIP:用于开放域视觉实体识别的高效对比基线

计算机视觉与模式识别 2026-05-15 v3

摘要

开放域视觉实体识别(VER)旨在将图像与百科全书式知识库中的实体(如维基百科)进行关联。最近针对VER设计的生成式方法表现良好,但计算成本高,限制了其可扩展性和实际部署。在本工作中,我们重新审视了VER中的对比范式,引入WikiCLIP,一个简单却有效的框架,为开放域VER建立了强大且高效的基线。WikiCLIP利用大型语言模型嵌入作为知识丰富的实体表示,并通过视觉引导知识适配器(VGKA)在patch级别将文本语义与视觉线索对齐。为进一步鼓励细粒度区分,硬性负采样机制(Hard Negative Synthesis Mechanism)在训练期间生成视觉相似但语义不同的负样本。在流行的开放域VER基准测试(如OVEN)上的实验结果表明,WikiCLIP显著优于强大基线。具体而言,WikiCLIP在挑战性的OVEN未见集合上实现了约16%的提升,而其推理延迟几乎减少了99%(相当于减少近100倍),以至于相较于领先的生成模型AutoVER。项目页面可访问于https://artanic30.github.io/project_pages/WikiCLIP/。

关键词

引用

@article{arxiv.2603.09921,
  title  = {WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition},
  author = {Shan Ning and Longtian Qiu and Jiaxuan Sun and Xuming He},
  journal= {arXiv preprint arXiv:2603.09921},
  year   = {2026}
}

备注

Accepted by CVPR26, codes and weights are publicly available