BuDDIE:面向多任务信息抽取的商业文件数据集
计算与语言
2024-04-08 v1
摘要
视觉丰富文档理解(VRDU)领域旨在解决在多模态领域中多个已研究的NLP任务。已存在若干数据集用于VRDU的特定任务研究,如文档分类(DC)、关键实体抽取(KEE)、实体链接、视觉问答(VQA)等。这些数据集涵盖的文档如发票和收据等,稀疏标注,仅支持一个或两个相关联的任务(例如,实体抽取和实体链接)。不过,仅关注特定类型文档或单一任务并不能真实反映文档在野外处理时所需的多样性——在后者场景中,预期会有风格和要求的多样性。本文介绍了BuDDIE(Business Document Dataset for Information Extraction,即信息抽取商业文件数据集),这是第一个包含1,665个真实商业文档的数据集,提供丰富且稠密的标注,用于DC、KEE和VQA。该数据集来自美国州政府网站上公开的商业实体文档。文档结构化且在不同州和类型(例如表格、证书、报告等)的风格和布局方面存在差异。我们提供了BuDDIE的数据多样性和质量指标,以及一系列基线模型,用于每个任务。我们的基线涵盖传统文本方法、多模态方法和大型语言模型方法。
引用
@article{arxiv.2404.04003,
title = {BuDDIE: A Business Document Dataset for Multi-task Information Extraction},
author = {Ran Zmigrod and Dongsheng Wang and Mathieu Sibue and Yulong Pei and Petr Babkin and Ivan Brugere and Xiaomo Liu and Nacho Navarro and Antony Papadimitriou and William Watson and Zhiqiang Ma and Armineh Nourbakhsh and Sameena Shah},
journal= {arXiv preprint arXiv:2404.04003},
year = {2024}
}