野外的视觉与认知:基于对比学习的大规模知识图谱开放域视觉实体识别
计算机视觉与模式识别
2026-03-27 v2 机器学习
摘要
开放域视觉实体识别旨在识别并链接图像中呈现的实体与来自 Wikidata 等广泛且不断演化的真实世界概念集合之间的关联。与具有固定标签集的常规分类任务不同,它在开放集条件下运行,其中大多数目标实体在训练期间未见过,并且呈现长尾分布。这使得该任务本身就具有挑战性,因为受限于监督信息、视觉模糊性以及语义消歧需求。我们提出了一种基于对比学习的知识引导框架 (KnowCoL),将图像和文本描述整合到由来自 Wikidata 的结构化信息所支撑的共享语义空间中。通过将视觉和文本输入抽象到概念层面,模型利用实体描述、类型层次结构和关系上下文来支持零样本实体识别。我们在包含 Wikidata ID 作为标签空间的 OVEN 数据集上评估了该方法。我们的实验表明,利用视觉信息、文本信息和结构化知识的整合显著提升了准确率,尤其是针对稀有且未见过的实体。我们的最小模型相较于最新方法在未见实体上的准确率提升 10.5%,尽管其规模仅为最新方法的 1/35。
引用
@article{arxiv.2510.13675,
title = {Seeing and Knowing in the Wild: Open-domain Visual Entity Recognition with Large-scale Knowledge Graphs via Contrastive Learning},
author = {Hongkuan Zhou and Lavdim Halilaj and Sebastian Monka and Stefan Schmid and Yuqicheng Zhu and Jingcheng Wu and Nadeem Nazer and Steffen Staab},
journal= {arXiv preprint arXiv:2510.13675},
year = {2026}
}
备注
Accepted by AAAI2026