迈向摆脱语言偏置与OCR错误:以语义为中心的文本视觉问答
计算机视觉与模式识别
2023-09-06 v1 多媒体
摘要
场景图像中的文本传达了用于场景理解与推理的关键信息。在基于文本的视觉问答(TextVQA)过程中,阅读与推理能力对模型至关重要。然而,当前的TextVQA模型不以文本为中心,并存在若干局限。由于在答案预测过程中缺乏语义引导,模型容易受到语言偏置和光学字符识别(OCR)错误的主导。本文中,我们提出了一种新颖的以语义为中心的网络(SC-Net),其由实例级对比语义预测模块(ICSP)和语义为中心Transformer模块(SCT)组成。借助这两个模块,以语义为中心的模型能够抵抗语言偏置以及来自OCR的累积错误。在TextVQA和ST-VQA数据集上的大量实验表明了我们的模型的有效性。SC-Net以显著优势超越先前工作,并且对TextVQA任务更为合理。
引用
@article{arxiv.2203.12929,
title = {Towards Escaping from Language Bias and OCR Error: Semantics-Centered Text Visual Question Answering},
author = {Chengyang Fang and Gangyan Zeng and Yu Zhou and Daiqing Wu and Can Ma and Dayong Hu and Weiping Wang},
journal= {arXiv preprint arXiv:2203.12929},
year = {2023}
}