面向视觉富文档图像的表格检测
计算机视觉与模式识别
2023-12-07 v2 信息检索
摘要
表格检测(TD)是实现视觉富文档理解的一项基础任务,它要求模型在不丢失信息的前提下提取信息。然而,当前流行的基于交并比(IoU)的检测模型评估指标与基于 IoU 的损失函数,无法直接表征预测结果的信息丢失程度。为此,我们提出将 IoU 解耦为真实框覆盖项和预测框覆盖项,其中前者可用于衡量预测结果的信息丢失。此外,考虑到文档图像中表格分布的稀疏性,我们以 SparseR-CNN 为基础模型,并通过使用高斯噪声增强图像尺寸的区域提议以及多对一标签分配进一步改进模型。综合实验结果表明,所提方法在不同数据集下使用不同基于 IoU 的指标均能稳定优于当前最优方法,并证明所提解耦 IoU 损失能使模型缓解信息丢失。
引用
@article{arxiv.2305.19181,
title = {Table Detection for Visually Rich Document Images},
author = {Bin Xiao and Murat Simsek and Burak Kantarci and Ala Abu Alkheir},
journal= {arXiv preprint arXiv:2305.19181},
year = {2023}
}
备注
Accepted by Knowledge-Based Systems