中文

迈向能看且能读的模型

计算机视觉与模式识别 2023-03-22 v2 机器学习

摘要

视觉问答(VQA)和图像描述(CAP)是最受欢迎的视觉-语言任务之一,它们有类似的场景文本版本,需要从图像中的文本进行推理。尽管它们明显相似,但二者被独立对待,并且如我们所展示的,产生了只能看或只能读、不能兼顾的任务特定方法。在这项工作中,我们对该现象进行了深入分析,并提出了UniTNT,一种统一文本-非文本方法(Unified Text-Non-Text approach),它赋予现有多模态架构场景文本理解能力。具体而言,我们将场景文本信息视为一种额外模态,通过专用模块将其与任何基于预训练编码器-解码器的架构融合。充分的实验表明,UniTNT催生了首个成功处理两类任务的单一模型。此外,我们展示了场景文本理解能力可将视觉-语言模型在通用VQA和CAP上的性能分别提升多达2.69%和0.6 CIDEr。

关键词

引用

@article{arxiv.2301.07389,
  title  = {Towards Models that Can See and Read},
  author = {Roy Ganz and Oren Nuriel and Aviad Aberdam and Yair Kittenplon and Shai Mazor and Ron Litman},
  journal= {arXiv preprint arXiv:2301.07389},
  year   = {2023}
}