利用视觉对齐序列坐标建模改进表格结构识别
计算机视觉与模式识别
2023-03-21 v2
摘要
表格结构识别旨在将非结构化表格图像的逻辑与物理结构提取为机器可读格式。最新的端到端图像到文本方法通过两个解码器同时预测两种结构,其中物理结构(单元格的边界框)的预测基于逻辑结构的表示。然而,先前的方法因逻辑表示缺乏局部视觉信息而难以获得精确边界框。为解决此问题,我们提出一种称为VAST的端到端序列建模表格结构识别框架。它包含一个由逻辑结构解码器非空单元格表示触发的新型坐标序列解码器。在坐标序列解码器中,我们将边界框坐标建模为语言序列,其中左、上、右、下坐标被顺序解码以利用坐标间依赖关系。此外,我们提出一种辅助视觉对齐损失,以强制非空单元格的逻辑表示包含更多局部视觉细节,从而有助于生成更好的单元格边界框。大量实验表明,我们所提方法在逻辑与物理结构识别上均能取得最先进(SOTA)结果。消融研究也验证了所提坐标序列解码器与视觉对齐损失是我们方法成功的关键。
引用
@article{arxiv.2303.06949,
title = {Improving Table Structure Recognition with Visual-Alignment Sequential Coordinate Modeling},
author = {Yongshuai Huang and Ning Lu and Dapeng Chen and Yibo Li and Zecheng Xie and Shenggao Zhu and Liangcai Gao and Wei Peng},
journal= {arXiv preprint arXiv:2303.06949},
year = {2023}
}
备注
CVPR2023