中文

分离与定位:重新审视基于文本的视觉问答中的文本

计算机视觉与模式识别 2023-09-01 v1 多媒体

摘要

基于文本的视觉问答(TextVQA)旨在回答关于图像中文本的问题。该领域大多数工作集中于设计网络结构或预训练任务。所有这些方法按阅读顺序(从左到右、从上到下)列出 OCR 文本以形成序列,并将其视为自然语言“句子”。然而,它们忽略了一个事实:TextVQA 任务中的大多数 OCR 单词并不具有语义上下文关系。此外,这些方法使用一维位置嵌入按顺序构建 OCR 词元之间的空间关系,这是不合理的。一维位置嵌入只能表示句子中单词之间的左右序列关系,而不能表示复杂的空间位置关系。为解决这些问题,我们提出了一种名为 Separate and Locate(SaL,分离与定位)的新方法,该方法探索文本上下文线索并设计空间位置嵌入以构建 OCR 文本之间的空间关系。具体而言,我们提出了一个文本语义分离(TSS)模块,帮助模型识别单词之间是否具有语义上下文关系。然后,我们引入了一个空间环形位置(SCP)模块,帮助模型更好地构建和推理 OCR 文本之间的空间位置关系。我们的 SaL 模型在 TextVQA 和 ST-VQA 数据集上比基线模型的准确率分别高出 4.44% 和 3.96%。与在 6400 万预训练样本上预训练的 SOTA 预训练方法相比,我们的方法无需任何预训练任务,仍在 TextVQA 和 ST-VQA 上取得了 2.68% 和 2.52% 的准确率提升。我们的代码和模型将发布于 https://github.com/fangbufang/SaL。

关键词

引用

@article{arxiv.2308.16383,
  title  = {Separate and Locate: Rethink the Text in Text-based Visual Question Answering},
  author = {Chengyang Fang and Jiangnan Li and Liang Li and Can Ma and Dayong Hu},
  journal= {arXiv preprint arXiv:2308.16383},
  year   = {2023}
}

备注

Accepted by ACM MM 2023