中文

千言胜于一图:以自然语言为中心的外界知识视觉问答

计算机视觉与模式识别 2022-01-17 v1 计算与语言 信息检索

摘要

外界知识视觉问答(OK-VQA)要求智能体理解图像、利用来自整个网络的相关知识,并消化所有信息以回答问题。大多数先前工作通过在多模态空间中首先融合图像与问题来解决该问题,这不利于与海量外部知识的进一步融合。在本文中,我们呼吁对 OK-VQA 任务进行范式转变,将图像转化为纯文本,从而能够在自然语言空间中实现知识段落检索与生成式问答。该范式利用了巨型知识库的庞大容量与预训练语言模型的丰富性。我们提出了一种 Transform-Retrieve-Generate 框架(TRiG),它可即插即用地替代不同的图像到文本模型与文本知识库。实验结果表明,我们的 TRiG 框架以至少 11.1% 的绝对优势优于所有当前最优(SOTA)监督方法。

关键词

引用

@article{arxiv.2201.05299,
  title  = {A Thousand Words Are Worth More Than a Picture: Natural Language-Centric Outside-Knowledge Visual Question Answering},
  author = {Feng Gao and Qing Ping and Govind Thattai and Aishwarya Reganti and Ying Nian Wu and Prem Natarajan},
  journal= {arXiv preprint arXiv:2201.05299},
  year   = {2022}
}