基于命名实体的知识型视觉问答的多模态逆完形填空任务
计算与语言
2023-01-12 v1 信息检索
机器学习
多媒体
摘要
我们提出了一种用于基于命名实体的知识型视觉问答(KVQAE)的新预训练方法——多模态逆完形填空任务。KVQAE是近期引入的一项任务,其目标是在视觉语境下利用知识库回答关于命名实体的问题。因此,模态之间的交互对于检索信息至关重要,且必须通过复杂的融合模型来捕捉。由于这些模型需要大量训练数据,我们基于文本问答的已有工作设计了此预训练任务。该任务将句子视为伪问题、将其语境视为伪相关段落,并通过考虑多模态文档中邻近文本的图像加以扩展。我们的方法适用于不同的神经网络架构,相较于无预训练基线,在检索和阅读理解上分别带来了9%的相对MRR和15%的相对F1提升。
引用
@article{arxiv.2301.04366,
title = {Multimodal Inverse Cloze Task for Knowledge-based Visual Question Answering},
author = {Paul Lerner and Olivier Ferret and Camille Guinaudeau},
journal= {arXiv preprint arXiv:2301.04366},
year = {2023}
}
备注
Accepted at ECIR 2023