中文

面向基于知识的视觉问答的跨模态检索

计算与语言 2024-01-12 v1 信息检索

摘要

关于命名实体的基于知识的视觉问答是一项具有挑战性的任务,需要从多模态知识库中检索信息。命名实体具有多样的视觉表示,因此难以识别。我们认为跨模态检索可能有助于弥合实体与其描绘之间的语义鸿沟,并且首先是对单模态检索的补充。我们通过使用多模态双编码器(即 CLIP)在最近的 ViQuAE、InfoSeek 和 Encyclopedic-VQA 数据集上的实验提供了经验证据。此外,我们研究了微调此类模型的三种不同策略:单模态、跨模态或联合训练。我们的方法结合了单模态和跨模态检索,在这三个数据集上与数十亿参数的模型具有竞争力,同时在概念上更简单且计算成本更低。

关键词

引用

@article{arxiv.2401.05736,
  title  = {Cross-modal Retrieval for Knowledge-based Visual Question Answering},
  author = {Paul Lerner and Olivier Ferret and Camille Guinaudeau},
  journal= {arXiv preprint arXiv:2401.05736},
  year   = {2024}
}