DELINE8K:用于历史文档语义分割的合成数据管道
计算机视觉与模式识别
2024-05-01 v1
摘要
文档语义分割是一个有前景的方向,可促进包括光学字符识别 (OCR)、表单分类和文档编辑在内的文档分析任务。虽然已 developed 了几个合成数据集以区分手写和打印文本,但它们在类别多样性和文档多样性方面不足。我们演示了在解决我们引入的国家档案馆表单语义分割数据集 (NAFSS) 时,现有数据集训练的局限性。为了解决这些局限性,我们提出了目前最全面的文档语义分割合成管道,整合来自超过10个来源的预打印文本、手写文本和文档背景,以创建文档元素层集成8000 (DELINE8K) 数据集。我们定制的数据集在NAFSS基准上表现出优异性能,证明其作为进一步研究的有前景的工具。DELINE8K 数据集可在 https://github.com/Tahlor/deline8k 获取。
引用
@article{arxiv.2404.19259,
title = {DELINE8K: A Synthetic Data Pipeline for the Semantic Segmentation of Historical Documents},
author = {Taylor Archibald and Tony Martinez},
journal= {arXiv preprint arXiv:2404.19259},
year = {2024}
}