中文

TAP-VL:面向丰富视觉-语言模型的文本布局感知预训练

计算机视觉与模式识别 2024-11-08 v1 人工智能

摘要

视觉-语言(VL)模型已引起大量研究兴趣,但它们在有效处理图像中的文本方面仍面临挑战。为解决这一局限,研究人员开发了两种方法。第一种方法利用外部光学字符识别(OCR)工具从图像中提取文本信息,然后将其添加到其他文本输入之前。第二种策略专注于使用极高分辨率图像以提升文本识别能力。在本文中,我们聚焦于改进第一种策略,提出了一种名为TAP-VL的新方法,将OCR信息视为一种独立模态并将其无缝集成到任何VL模型中。TAP-VL采用轻量级基于Transformer的OCR模块接收带有布局信息的OCR,将其压缩为短固定长度序列以输入大语言模型(LLM)。最初,我们对OCR模块进行模型无关的预训练,使用无标注文档,随后通过简短微调将其集成到任何VL架构中。大量实验表明,将TAP-VL应用于顶尖VL模型后,在场景文本和基于文档的VL基准测试中均实现了持续的性能提升。

关键词

引用

@article{arxiv.2411.04642,
  title  = {TAP-VL: Text Layout-Aware Pre-training for Enriched Vision-Language Models},
  author = {Jonathan Fhima and Elad Ben Avraham and Oren Nuriel and Yair Kittenplon and Roy Ganz and Aviad Aberdam and Ron Litman},
  journal= {arXiv preprint arXiv:2411.04642},
  year   = {2024}
}