中文

在手写文档集合上提问问答

计算机视觉与模式识别 2021-10-05 v1

摘要

本工作解决手写文档集合上的问答(QA)问题。与答案通常为短文本的常规 QA 和视觉问答(VQA)形式不同,我们的目标在于定位答案所在的文档片段。所提方法无需识别文档中的文本即可工作。我们认为,对于鲁棒文本识别往往困难的手写文档和历史收藏,这种免识别方法是合适的。同时,对于人类用户而言,包含答案的文档图像片段可作为文本答案的有效替代。所提方法使用现成的深度嵌入网络,该网络可将文本词与词图像一同投影到一个公共子空间中。这种嵌入桥接了文本与视觉域,并帮助我们检索可能回答问题的文档片段。我们在两个新数据集上评估所提方法的结果:(i)HW-SQuAD:SQuAD1.0 数据集的合成手写文档图像对应版本;(ii)BenthamQA:在流行的 Bentham 手稿集合文档上定义的一小组 QA 对。我们还对提出的免识别方法与基于识别的方法(使用 OCR 从图像中识别文本)进行了深入分析。本工作中呈现的数据集可在 docvqa.org 下载。

关键词

引用

@article{arxiv.2110.00711,
  title  = {Asking questions on handwritten document collections},
  author = {Minesh Mathew and Lluis Gomez and Dimosthenis Karatzas and CV Jawahar},
  journal= {arXiv preprint arXiv:2110.00711},
  year   = {2021}
}

备注

pre-print version