DocILE 2023 预告:文档信息定位与抽取
机器学习
2023-01-31 v1 人工智能
摘要
用于从半结构化商业文档中抽取信息(IE)的数据匮乏是 IE 社区的一个现实问题。依赖大规模数据集的出版物由于此类文档的敏感性仅使用专有的、未公开的数据。公开可用的数据集大多规模小且领域特定。缺乏大规模公共数据集或基准阻碍了已发表方法的可复现性与交叉评估。作为 CLEF 2023 会议的一个 lab 以及 ICDAR 2023 竞赛举办的 DocILE 2023 竞赛,将运行首个针对商业文档中关键信息定位与抽取(KILE)和行项目识别(LIR)任务的重要基准。凭借来自开放来源的数千份标注真实文档、十万份生成的合成文档以及近百万份未标注文档,DocILE lab 带来了规模最大的公开 KILE 与 LIR 数据集。我们期待来自计算机视觉、自然语言处理、信息检索及其他社区的贡献。有关该 lab 与竞赛的数据、基线、代码及最新信息可在 https://docile.rossum.ai/ 获取。
引用
@article{arxiv.2301.12394,
title = {DocILE 2023 Teaser: Document Information Localization and Extraction},
author = {Štěpán Šimsa and Milan Šulc and Matyáš Skalický and Yash Patel and Ahmed Hamdi},
journal= {arXiv preprint arXiv:2301.12394},
year = {2023}
}
备注
Accepted to ECIR 2023