中文

TabPedia:基于概念协同的全面视觉表格理解

计算机视觉与模式识别 2024-10-14 v2

摘要

表格包含事实性和定量数据,并伴有各种结构和内容,这对机器理解构成了挑战。以往的方法通常为单个任务设计特定于任务的架构和目标,导致模态隔离和工作流程复杂。本文提出了一种新颖的大型视觉语言模型TabPedia,该模型配备了概念协同机制。在该机制中,所有涉及的不同视觉表格理解(VTU)任务和多源视觉嵌入都被抽象为概念。这个统一框架使TabPedia能够通过利用大型语言模型(LLM)的能力,无缝集成VTU任务,例如表格检测、表格结构识别、表格查询和表格问答。此外,概念协同机制使得表格感知相关任务和理解相关任务能够和谐地工作,因为它们可以有效地从相应的源感知嵌入中利用所需的线索。此外,为了更好地评估现实场景中的VTU任务,我们建立了一个新的综合性表格VQA基准ComTQA,包含约9000个问答对。在多个公开基准上进行的广泛定量和定性实验(涵盖表格感知和理解任务)验证了我们TabPedia的有效性。优越的性能进一步证实了当所有概念协同工作时,使用LLM理解视觉表格的可行性。基准ComTQA已在https://huggingface.co/datasets/ByteDance/ComTQA开源。源代码和模型也已发布在https://github.com/zhaowc-ustc/TabPedia。

关键词

引用

@article{arxiv.2406.01326,
  title  = {TabPedia: Towards Comprehensive Visual Table Understanding with Concept Synergy},
  author = {Weichao Zhao and Hao Feng and Qi Liu and Jingqun Tang and Shu Wei and Binghong Wu and Lei Liao and Yongjie Ye and Hao Liu and Wengang Zhou and Houqiang Li and Can Huang},
  journal= {arXiv preprint arXiv:2406.01326},
  year   = {2024}
}

备注

Accepted by NeurIPS 2024