中文

UniTabNet:连接视觉与语言模型以增强表格结构识别

计算机视觉与模式识别 2024-09-23 v1

摘要

在数字时代,表格结构识别技术是处理和分析大量表格数据的关键工具。以往的方法主要关注表格结构恢复的视觉方面,但往往无法有效理解表格内的文本语义,特别是描述性文本单元格。在本文中,我们介绍了 UniTabNet,一种基于图像到文本模型的表格结构解析新框架。UniTabNet 采用“分治”策略,利用图像到文本模型解耦表格单元格,并集成物理和逻辑解码器以重建完整的表格结构。我们通过 Vision Guider 进一步增强了该框架,它引导模型关注相关区域,从而提高预测精度。此外,我们引入了 Language Guider 以提升模型理解表格图像中文本语义的能力。在 PubTabNet、PubTables1M、WTW 和 iFLYTAB 等知名表格结构数据集上的评估表明,UniTabNet 实现了新的 SOTA 性能,证明了我们方法的有效性。代码也将公开发布。

关键词

引用

@article{arxiv.2409.13148,
  title  = {UniTabNet: Bridging Vision and Language Models for Enhanced Table Structure Recognition},
  author = {Zhenrong Zhang and Shuhang Liu and Pengfei Hu and Jiefeng Ma and Jun Du and Jianshu Zhang and Yu Hu},
  journal= {arXiv preprint arXiv:2409.13148},
  year   = {2024}
}