合成用于表格识别的真实数据
计算机视觉与模式识别
2025-03-13 v2 机器学习
摘要
为了克服当前自动表格数据标注方法和随机表格数据合成方法的局限性与挑战,我们提出了一种专门用于表格识别的合成标注数据的新方法。该方法利用现有复杂表格的结构和内容,能够高效创建与目标域真实风格高度相似的表格。通过利用中文金融公告中表格的实际结构和内容,我们构建了该领域首个大规模表格标注数据集。我们使用该数据集训练了多个基于深度学习的最新端到端表格识别模型。此外,我们还为中文金融公告领域的真实复杂表格建立了首个基准,并利用该基准评估了在我们的合成数据上训练的模型性能,从而有效验证了我们方法的实用性和有效性。进一步地,我们将我们的合成方法应用于从英文金融公告中提取的FinTabNet数据集,通过增加包含多个跨单元格的表格比例来引入更高的复杂度。实验表明,在该增强数据集上训练的模型在性能上取得了全面提升,尤其是在识别包含多个跨单元格的表格方面。
引用
@article{arxiv.2404.11100,
title = {Synthesizing Realistic Data for Table Recognition},
author = {Qiyu Hou and Jun Wang and Meixuan Qiao and Lujun Tian},
journal= {arXiv preprint arXiv:2404.11100},
year = {2025}
}
备注
ICDAR 2024