SRFUND:表单理解中的多粒度层次结构重建基准
计算与语言
2024-06-14 v1 人工智能
摘要
在表单理解领域,准确识别和组织文本内容对于文档处理的自动化至关重要。现有的数据集,如FUNSD和XFUND,支持实体分类和关系预测任务,但通常局限于局部和实体级别的标注。这种局限性忽略了文档的层次结构表示,限制了对复杂表单的全面理解。为了解决这个问题,我们提出了SRFUND,一个层次结构化的多任务表单理解基准。SRFUND在原始FUNSD和XFUND数据集的基础上提供了精细化的标注,涵盖了五个任务:(1) 单词到文本行合并,(2) 文本行到实体合并,(3) 实体类别分类,(4) 项目表格定位,以及 (5) 基于实体的全文档层次结构恢复。我们精心补充了原始数据集中缺失的各种粒度级别的标注,并为表单中的多项目表格区域添加了详细的标注。此外,我们为实体关系预测任务引入了全局层次结构依赖关系,超越了传统的局部键值关联。SRFUND数据集包含八种语言,包括英语、中文、日语、德语、法语、西班牙语、意大利语和葡萄牙语,使其成为跨语言表单理解的强大工具。大量的实验结果表明,SRFUND数据集在处理表单的多样化布局和全局层次结构方面提出了新的挑战和重要机遇,从而为表单理解领域提供了深刻的见解。原始数据集和基线方法的实现可在 https://sprateam-ustc.github.io/SRFUND 获取。
引用
@article{arxiv.2406.08757,
title = {SRFUND: A Multi-Granularity Hierarchical Structure Reconstruction Benchmark in Form Understanding},
author = {Jiefeng Ma and Yan Wang and Chenyu Liu and Jun Du and Yu Hu and Zhenrong Zhang and Pengfei Hu and Qing Wang and Jianshu Zhang},
journal= {arXiv preprint arXiv:2406.08757},
year = {2024}
}
备注
NeurIPS 2024 Track on Datasets and Benchmarks under review