TC-OCR: TableCraft OCR——高效检测与识别表格结构与内容
计算机视觉与模式识别
2024-04-22 v2
摘要
文档图像中表格数据的自动识别由于表格样式的多样性和复杂结构而面临重大挑战。表格提供了有价值的内容表示,增强了搜索引擎和知识图谱等各种系统的预测能力。解决表格检测(TD)和表格结构识别(TSR)这两个主要问题传统上是独立进行的。在本研究中,我们提出了一个端到端的流水线,集成了深度学习模型,包括DETR、CascadeTabNet和PP OCR v2,以实现全面的基于图像的表格识别。这种集成方法有效处理了多样的表格样式、复杂结构和图像畸变,与Table Transformers等现有方法相比,提高了准确性和效率。我们的系统实现了同时的表格检测(TD)、表格结构识别(TSR)和表格内容识别(TCR),保留了表格结构并从文档图像中准确提取表格数据。多个模型的集成解决了表格识别的复杂性,使我们的方法成为基于图像的表格理解、数据提取和信息检索应用的有前景的解决方案。我们提出的方法实现了0.96的IOU和78%的OCR准确率,与之前的Table Transformer方法相比,OCR准确率显著提高了约25%。
引用
@article{arxiv.2404.10305,
title = {TC-OCR: TableCraft OCR for Efficient Detection & Recognition of Table Structure & Content},
author = {Avinash Anand and Raj Jaiswal and Pijush Bhuyan and Mohit Gupta and Siddhesh Bangar and Md. Modassir Imam and Rajiv Ratn Shah and Shin'ichi Satoh},
journal= {arXiv preprint arXiv:2404.10305},
year = {2024}
}
备注
8 pages, 2 figures, Workshop of 1st MMIR Deep Multimodal Learning for Information Retrieval