CommonForms:一个用于表单字段检测的大型多样化数据集
计算机视觉与模式识别
2025-09-23 v1 机器学习
摘要
本文介绍了 CommonForms,一个用于表单字段检测的网络规模数据集。它将表单字段检测问题转化为目标检测问题:给定一个页面图像,预测表单字段的位置和类型(文本输入、选择按钮、签名)。该数据集通过过滤 Common Crawl 来查找具有可填充元素的 PDF 文件而构建。从 800 万份文档开始,经过过滤过程,最终得到约 5.5 万份文档,包含超过 45 万页。分析表明,该数据集包含多样化的语言和领域组合;三分之一的页面是非英语的,在 14 个已分类的领域中,没有一个领域占数据集的 25% 以上。此外,本文还提出了一系列表单字段检测器 FFDNet-Small 和 FFDNet-Large,它们在 CommonForms 测试集上获得了非常高的平均精度。每个模型的训练成本低于 500 美元。消融结果表明,高分辨率输入对于高质量的表单字段检测至关重要,并且与使用 Common Crawl 中所有具有可填充字段的 PDF 相比,清洗过程提高了数据效率。定性分析表明,它们的性能优于一款流行的、可准备表单的商业 PDF 阅读器。与最流行的商业解决方案不同,FFDNet 除了可以预测文本和签名字段外,还可以预测复选框。据我们所知,这是第一个为表单字段检测发布的大规模数据集,也是第一个开源模型。数据集、模型和代码将在 https://github.com/jbarrow/commonforms 发布。
引用
@article{arxiv.2509.16506,
title = {CommonForms: A Large, Diverse Dataset for Form Field Detection},
author = {Joe Barrow},
journal= {arXiv preprint arXiv:2509.16506},
year = {2025}
}