面向建筑行业的开放且可扩展的表格结构识别数据集——CISOL
计算机视觉与模式识别
2025-01-28 v1
摘要
可重复性和可复制性是机器学习领域的关键支柱,这取决于模型的可用性以及用于训练和评估这些模型的数据集。在本文中,我们介绍了 Construction Industry Steel Ordering List (CISOL) 数据集,其开发着重于透明度,以确保可重复性、可复制性和可扩展性。CISOL 提供了一个宝贵的新的研究资源,凸显了即使在建筑领域这样细窄的应用领域(如表格提取),也拥有多样化数据集的重要性。CISOL 独特之处在于其包含来自行业的真实建筑文档,使其成为该领域的独特贡献。该数据集包含超过 12 万个在 800 多张文档图像上的标注实例,使其成为一个中等规模的数据集,为表格结构识别(TSR)和表格检测(TD)任务提供了稳健的基础。基准测试结果表明,CISOL 使用 YOLOv8 模型在 67.22 [email protected]:0.95:0.05 上 outperform 了针对 TSR 的特定模型 TATR。这突显了 CISOL 作为推动 TSR,尤其是在专业领域中发展的有效基准。
引用
@article{arxiv.2501.15469,
title = {CISOL: An Open and Extensible Dataset for Table Structure Recognition in the Construction Industry},
author = {David Tschirschwitz and Volker Rodehorst},
journal= {arXiv preprint arXiv:2501.15469},
year = {2025}
}
备注
Accepted at WACV2025