中文

表格理解的视觉语言模型:挑战与机遇

计算机视觉与模式识别 2024-09-27 v2

摘要

本文探讨了视觉语言模型(VLMs)在电子表格理解方面的能力。我们提出了三个自监督挑战及相应的评估指标,以全面评估 VLMs 在光学字符识别(OCR)、空间感知和视觉格式识别方面的表现。此外,我们利用表格检测任务来评估 VLMs 的整体性能,方法是将这些挑战集成到其中。为更细致地探索 VLMs,本文提出了三种表格到图像的设置:列宽调整、样式更改和地址增强。我们提出了针对不同设置的变体提示来解决上述任务。值得注意的是,为了利用 VLMs 在理解文本方面的优势而非二维位置,本文提出在表格边界检测中解码表格四个边界的单元格值。我们的发现表明,VLMs 在 OCR 方面表现有前景,但由于单元格遗漏和错位,结果不令人满意;而且它们在空间和格式识别方面表现不足,这激励未来的工作通过我们的方法在各种设置下生成大量表格-图像对来增强 VLMs 的表格数据理解能力。

关键词

引用

@article{arxiv.2405.16234,
  title  = {Vision Language Models for Spreadsheet Understanding: Challenges and Opportunities},
  author = {Shiyu Xia and Junyu Xiong and Haoyu Dong and Jianbo Zhao and Yuzhang Tian and Mengyu Zhou and Yeye He and Shi Han and Dongmei Zhang},
  journal= {arXiv preprint arXiv:2405.16234},
  year   = {2024}
}