中文

表中全数据:面向跨模态科学信息抽取的新数据集与基准

计算与语言 2023-12-19 v3

摘要

从科学论文中抽取关键信息有潜力帮助研究人员更高效工作并加速科学进展。过去几年中,科学信息抽取(SciIE)研究见证了若干新系统与基准的发布。然而,现有以论文为中心的数据集大多仅关注稿件特定部分(如摘要)且为单模态(即仅文本或仅表格),这是由于处理复杂且标注昂贵。此外,核心信息可能出现在文本中、表格中或跨越二者。为弥补数据可用性方面的这一缺口并支持跨模态信息抽取,同时降低标注成本,我们提出一种半监督流水线,以迭代方式标注文本中的实体以及表格中的实体与关系。基于该流水线,我们为科学界发布新型资源,包括高质量基准、大规模语料库和半监督标注流水线。我们进一步报告了最先进IE模型在所提基准数据集上的性能作为基线。最后,我们探索了诸如ChatGPT等大型语言模型在当前任务上的潜在能力。我们的新数据集、结果与分析验证了半监督流水线的有效性与高效性,并讨论了其尚存局限。

关键词

引用

@article{arxiv.2311.08189,
  title  = {All Data on the Table: Novel Dataset and Benchmark for Cross-Modality Scientific Information Extraction},
  author = {Yuhan Li and Jian Wu and Zhiwei Yu and Börje F. Karlsson and Wei Shen and Manabu Okumura and Chin-Yew Lin},
  journal= {arXiv preprint arXiv:2311.08189},
  year   = {2023}
}

备注

Work in progress; 17 pages, 6 figures, 11 tables