一种用于基于图像的表格识别的端到端多任务学习模型
计算机视觉与模式识别
2023-03-30 v2
摘要
基于图像的表格识别是一项具有挑战性的任务,原因在于表格样式的多样性以及表格结构的复杂性。以往大多数方法侧重于非端到端的思路,将问题划分为两个独立的子问题:表格结构识别,以及单元格内容识别,然后尝试使用两个独立的系统分别求解每个子问题。本文中,我们提出了一种用于基于图像的表格识别的端到端多任务学习模型。所提模型由一个共享编码器、一个共享解码器以及三个独立的解码器组成,用于学习表格识别的三个子任务:表格结构识别、单元格检测与单元格内容识别。整个系统可以方便地以端到端方式进行训练和推理。在实验中,我们在两个大规模数据集 FinTabNet 和 PubTabNet 上评估了所提模型的性能。实验结果表明,所提模型在所有基准数据集上均优于当前最优(state-of-the-art)方法。
引用
@article{arxiv.2303.08648,
title = {An End-to-End Multi-Task Learning Model for Image-based Table Recognition},
author = {Nam Tuan Ly and Atsuhiro Takasu},
journal= {arXiv preprint arXiv:2303.08648},
year = {2023}
}
备注
10 pages, VISAPP2023. arXiv admin note: substantial text overlap with arXiv:2303.07641