中文

TDeLTA:一种基于学习文本排列的轻量级鲁棒表格检测方法

计算与语言 2023-12-19 v1 人工智能

摘要

表格的多样性使得表格检测成为一大挑战,导致现有模型变得繁琐且复杂。尽管实现了高性能,但它们往往过拟合于训练集中的表格风格,并在遇到其他领域的分布外表格时遭受显著的性能下降。为解决这一问题,我们从表格的本质出发,即表格是一组按行和列排列的文本。基于此,我们提出了一种新颖的、轻量级且鲁棒的基于学习文本排列的表格检测方法,即 TDeLTA。TDeLTA 以文本块为输入,然后利用序列编码器和注意力模块对其排列进行建模。为了精确定位表格,我们设计了一个文本分类任务,根据文本块在表格中的语义角色将其分为 4 类。实验分别在从 PDF 解析的文本块和由开源 OCR 工具提取的文本块上进行。与几种最先进的方法相比,TDeLTA 在大规模公共数据集上仅用 3.1M 模型参数就取得了具有竞争力的结果。此外,在面对 0-shot 设置下的跨域数据时,TDeLTA 以近 7% 的大幅优势超越基线,显示了所提出模型的强大鲁棒性和迁移能力。

关键词

引用

@article{arxiv.2312.11043,
  title  = {TDeLTA: A Light-weight and Robust Table Detection Method based on Learning Text Arrangement},
  author = {Yang Fan and Xiangping Wu and Qingcai Chen and Heng Li and Yan Huang and Zhixiang Cai and Qitian Wu},
  journal= {arXiv preprint arXiv:2312.11043},
  year   = {2023}
}

备注

AAAI 2024