TAP:面向文本视觉问答与文本图像描述的文本感知预训练
计算机视觉与模式识别
2020-12-09 v1
摘要
在本文中,我们提出用于文本视觉问答(Text-VQA)和文本图像描述(Text-Caption)任务的文本感知预训练(TAP)。这两个任务分别旨在读取并理解图像中的场景文本以进行问答和图像描述生成。与未能捕捉场景文本及其与视觉和文本模态关系的常规视觉-语言预训练不同,TAP显式地将场景文本(由OCR引擎生成)纳入预训练。通过三个预训练任务,包括掩码语言建模(MLM)、图像-文本(对比)匹配(ITM)和相对(空间)位置预测(RPP),TAP有效帮助模型学习三种模态之间更好对齐的表示:文本词、视觉对象和场景文本。由于这种对齐表示学习,即使在相同的下游任务数据集上预训练,TAP相较于非TAP基线已在TextVQA数据集上将绝对准确率提升了+5.4%。为了进一步提升性能,我们基于Conceptual Caption数据集构建了一个大规模数据集,名为OCR-CC,包含140万条场景文本相关的图像-文本对。在该OCR-CC数据集上预训练后,我们的方法在多个任务上以较大优势超越最先进水平,即在TextVQA上准确率+8.3%,在ST-VQA上准确率+8.6%,在TextCaps上CIDEr分数+10.2。
引用
@article{arxiv.2012.04638,
title = {TAP: Text-Aware Pre-training for Text-VQA and Text-Caption},
author = {Zhengyuan Yang and Yijuan Lu and Jianfeng Wang and Xi Yin and Dinei Florencio and Lijuan Wang and Cha Zhang and Lei Zhang and Jiebo Luo},
journal= {arXiv preprint arXiv:2012.04638},
year = {2020}
}