中文

PreSTU:面向场景文本理解的预训练

计算机视觉与模式识别 2023-08-22 v3 计算与语言

摘要

识别并推理嵌入视觉输入中的文本的能力常为视觉-语言(V&L)模型所欠缺,或许因为V&L预训练方法往往未将其训练目标纳入此种能力。本文中,我们提出PreSTU,一种专用于场景文本理解(STU)的新型预训练方案。PreSTU引入OCR感知的预训练目标,鼓励模型从图像中识别文本并将其与图像其余内容相连。我们使用简单的基于transformer的编码器-解码器架构实现PreSTU,并结合从现成OCR系统获得的带场景文本的大规模图像-文本数据集。我们在八个视觉问答与四个图像描述基准上实证展示了该预训练方法的有效性。

关键词

引用

@article{arxiv.2209.05534,
  title  = {PreSTU: Pre-Training for Scene-Text Understanding},
  author = {Jihyung Kil and Soravit Changpinyo and Xi Chen and Hexiang Hu and Sebastian Goodman and Wei-Lun Chao and Radu Soricut},
  journal= {arXiv preprint arXiv:2209.05534},
  year   = {2023}
}

备注

Accepted to ICCV 2023