中文

TextCoT:放大以增强多模态富文本图像理解

计算机视觉与模式识别 2024-04-16 v1

摘要

大型多模态模型(LMMs)的出现引发了旨在利用其卓越推理能力的研究热潮。然而,在理解富文本图像方面,充分利用 LMMs 潜力的挑战依然存在,且现有方法难以有效处理高分辨率图像。在本工作中,我们提出了 TextCoT,一种用于富文本图像理解的新型思维链框架。TextCoT 利用 LMMs 的描述能力来掌握图像的全局上下文,并利用定位能力来检查局部文本区域。这允许提取全局和局部视觉信息,从而促进更准确的问答。在技术上,TextCoT 包含三个阶段,包括图像概览、粗略定位和细粒度观察。图像概览阶段提供对全局场景信息的全面理解,粗略定位阶段根据所提问题近似包含答案的图像区域。然后,整合所获得的全局图像描述,最后阶段进一步检查特定区域以提供准确答案。我们的方法无需额外训练,提供即插即用功能。基于几种先进的 LMMs,在一系列富文本图像问答基准数据集上进行了大量实验,结果证明了我们方法的有效性和强大的泛化能力。代码可在 https://github.com/bzluan/TextCoT 获取。

关键词

引用

@article{arxiv.2404.09797,
  title  = {TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding},
  author = {Bozhi Luan and Hao Feng and Hong Chen and Yonghui Wang and Wengang Zhou and Houqiang Li},
  journal= {arXiv preprint arXiv:2404.09797},
  year   = {2024}
}