中文

TableSeq:结构、内容与布局的统一生成

计算机视觉与模式识别 2026-04-20 v1

摘要

我们提出 TableSeq,一个仅基于图像的、端到端的框架,用于联合表格结构识别、内容识别和单元格定位。该模型将这些任务定义为单个序列生成问题:一个 decoder 生成交错的 HTML 标签、单元格文本和离散化坐标 token,从而在统一的自回归序列中对齐逻辑结构、文本内容和单元格几何。该设计避免了外部 OCR、辅助 decoder 和复杂的多阶段后处理。TableSeq 将轻量级高分辨率 FCN-H16 encoder 与最小结构先验 head 和单层 transformer encoder 组合,形成一个紧凑的架构,能够处理具有挑战性的布局。在标准基准测试中,TableSeq 实现了具竞争力或领先的结果,同时保持架构的简单性。在 PubTabNet 上达到 95.23 TEDS / 96.83 S-TEDS,在 FinTabNet 上达到 97.45 TEDS / 98.69 S-TEDS,在 SciTSR 的 CAR 协议下达到 99.79 / 99.54 / 99.66 的精确率/召回率/F1,在 PubTables-1M 的 GriTS 下保持竞争力。除 TSR/TCR 外,相同的序列接口还可用于无任务特定 head 的基于索引的表格查询,实现最佳 IRDR 分数和具竞争力的 ICDR/ICR 性能。我们还研究了多 token 预测以实现更快的块状解码,表明它仅在有限的精度退化下降低了推理延迟。总体而言,TableSeq 提供了一个实用且可复现的单流 baseline,用于统一表格识别,源代码将在 https://github.com/hamdilaziz/TableSeq 上公开。

关键词

引用

@article{arxiv.2604.16070,
  title  = {TableSeq: Unified Generation of Structure, Content, and Layout},
  author = {Laziz Hamdi and Amine Tamasna and Pascal Boisson and Thierry Paquet},
  journal= {arXiv preprint arXiv:2604.16070},
  year   = {2026}
}