中文

CV-Probes: 研究词汇知识与世界知识在视觉锚定动词理解中的相互作用

计算与语言 2025-07-15 v2

摘要

视觉语言(VL)变压器模型如何将动词短语锚定到视觉语境中,并且在这一过程中是否整合了上下文知识和世界知识?我们引入了 CV-Probes 数据集,其中包含涉及需要两种社交知识和视觉语境才能解释的动词短语的图像-标题对(例如“beg”),以及可以仅基于图像中直接可用信息进行锚定的动词短语的图像-标题对(例如“sit”)。我们表明,VL 模型在强烈依赖上下文的动词短语锚定方面存在困难。进一步的可解释 AI 技术分析显示,这些模型可能未足够关注标题中的动词标记。我们的结果表明,在 VL 模型训练和评估方面仍需要改进的方法。代码和数据集将在 https://github.com/ivana-13/CV-Probes 上提供。

关键词

引用

@article{arxiv.2409.01389,
  title  = {CV-Probes: Studying the interplay of lexical and world knowledge in visually grounded verb understanding},
  author = {Ivana Beňová and Michal Gregor and Albert Gatt},
  journal= {arXiv preprint arXiv:2409.01389},
  year   = {2025}
}

备注

9 pages, 2 figure, 6 tables, CogSci conference 2025