ExStrucTiny:面向文档图像的模式可变结构化信息抽取基准
计算与语言
2026-02-13 v1
摘要
企业文档(如表格和报告)嵌入了用于数据归档、自动化工作流程和分析的关键信息。虽然通用视觉语言模型(VLM)在 established document understanding benchmarks 上表现良好,但其在跨越多种文档类型和灵活模式进行整体、细粒度结构化抽取方面的能力尚未得到充分研究。现有的关键实体抽取(KEE)、关系抽取(RE)和视觉问答(VQA)数据集受限于狭窄实体本体、简单查询或单一文档类型,往往忽视了灵活且结构化抽取的需求。为此,我们引入 ExStrucTiny,一个新的文档图像结构化信息抽取基准数据集,统一了 KEE、RE 和 VQA 的方面。我们通过一种新颖的由人工与合成人类验证样本混合构建的管道,使 ExStrucTiny 覆盖更广泛的文档类型和抽取场景。我们对开放式和封闭式 VLM 在此基准上的表现进行分析,突出了模式适应、查询不完整以及答案定位等挑战。我们希望本工作为改进通用模型用于文档结构化信息抽取提供基石。
引用
@article{arxiv.2602.12203,
title = {ExStrucTiny: A Benchmark for Schema-Variable Structured Information Extraction from Document Images},
author = {Mathieu Sibue and Andres Muñoz Garza and Samuel Mensah and Pranav Shetty and Zhiqiang Ma and Xiaomo Liu and Manuela Veloso},
journal= {arXiv preprint arXiv:2602.12203},
year = {2026}
}
备注
EACL 2026, main conference