中文

多问题多答案的文本视觉问答方法

计算机视觉与模式识别 2023-11-16 v1 计算与语言 机器学习

摘要

我们提出多问题多答案(MQMA),一种在编码器-解码器Transformer模型中执行文本视觉问答(text-VQA)的新方法。文本-VQA任务要求模型通过理解多模态内容(文本,通常来自OCR,以及关联图像)来回答问题。据我们所知,几乎所有先前的文本-VQA方法都处理单个问题及其关联内容以预测单个答案。为了回答同一图像上的多个问题,每个问题和内容需多次输入模型。相比之下,我们提出的MQMA方法在编码器端输入多个问题和内容,并在解码器端以自回归方式同时预测多个答案。我们对标准编码器-解码器Transformer进行了若干新颖的架构修改以支持MQMA。我们还提出了一种新颖的MQMA去噪预训练任务,旨在教会模型将多个问题及内容与对应答案进行对齐和区分。MQMA预训练模型在多个文本-VQA数据集上取得了最先进的结果,每个数据集均具有强基线。具体而言,在OCR-VQA(+2.5%)、TextVQA(+1.4%)、ST-VQA(+0.6%)、DocVQA(+1.1%)上相对先前最先进方法取得了绝对提升。

关键词

引用

@article{arxiv.2311.08622,
  title  = {Multiple-Question Multiple-Answer Text-VQA},
  author = {Peng Tang and Srikar Appalaraju and R. Manmatha and Yusheng Xie and Vijay Mahadevan},
  journal= {arXiv preprint arXiv:2311.08622},
  year   = {2023}
}