中文

高性能表格结构识别 Transformer 需要早期卷积

计算机视觉与模式识别 2023-11-10 v1 机器学习

摘要

表格结构识别(TSR)旨在将表格图像转换为机器可读格式,其中视觉编码器提取图像特征,文本解码器生成表示表格的令牌。现有方法使用经典卷积神经网络(CNN)骨干作为视觉编码器,使用 Transformer 作为文本解码器。然而,这种混合 CNN-Transformer 架构引入了复杂的视觉编码器,其几乎占模型总参数的一半,显著降低了训练与推理速度,并阻碍了 TSR 中自监督学习的潜力。在本工作中,我们设计了一种轻量级视觉编码器用于 TSR,且不牺牲表达能力。我们发现卷积干(convolutional stem)能以更简单的模型匹配经典 CNN 骨干的性能。卷积干在两项对高性能 TSR 至关重要的因素之间取得了最优平衡:更高的感受野(RF)比与更长的序列长度。这使其能“看到”表格的适当部分,并在足够上下文长度内“存储”复杂表格结构,以供后续 Transformer 使用。我们进行了可复现的消融研究,并在 https://github.com/poloclub/tsr-convstem 开源了代码,以提升透明度、激发创新,并促进行业内公平比较,因为表格作为一种有前景的模态正用于表示学习。

关键词

引用

@article{arxiv.2311.05565,
  title  = {High-Performance Transformers for Table Structure Recognition Need Early Convolutions},
  author = {ShengYun Peng and Seongmin Lee and Xiaojing Wang and Rajarajeswari Balasubramaniyan and Duen Horng Chau},
  journal= {arXiv preprint arXiv:2311.05565},
  year   = {2023}
}

备注

Table Representation Learning Workshop at NeurIPS 2023 (Oral)