中文

ICDAR 2021 科学文献解析竞赛

信息检索 2021-06-29 v1

摘要

科学文献包含与多领域前沿创新相关的重要信息。自然语言处理的进展一直推动着科学文献自动化信息抽取的快速发展。然而,科学文献常以非结构化PDF格式存在。尽管PDF在保留基本视觉元素(如字符、线条、形状等)以向人类呈现方面表现出色,但机器对PDF格式的自动处理面临诸多挑战。鉴于现存超过2.5万亿份PDF文档,这些问题在许多其他重要应用领域中亦十分普遍。我们的ICDAR 2021科学文献解析竞赛(ICDAR2021-SLP)旨在专门推动文档理解方面的进展。ICDAR2021-SLP依托PubLayNet与PubTabNet数据集,提供数十万训练与评估样例。在任务A(文档版式识别)中,性能最优的提交结合了目标检测与针对各类别的专用方案。在任务B(表格识别)中,顶尖提交依赖于识别表格组件的方法及用于生成表格结构与内容的后处理方法。两项任务的结果均展现出令人印象深刻的性能,并为高性能实际应用开辟了可能。

关键词

引用

@article{arxiv.2106.14616,
  title  = {ICDAR 2021 Competition on Scientific Literature Parsing},
  author = {Antonio Jimeno Yepes and Xu Zhong and Douglas Burdick},
  journal= {arXiv preprint arXiv:2106.14616},
  year   = {2021}
}