中文

面向实体与文档级关系抽取的领域特定精选基准

计算与语言 2026-02-05 v1

摘要

信息抽取(IE)涵盖命名实体识别(NER)、命名实体链接(NEL)和关系抽取(RE),是将快速增长的科学文献转化为结构化、可操作知识的关键任务。这一需求在肠脑轴等快速发展的生物医学领域尤为突出,后者研究肠道微生物与脑相关疾病之间的复杂相互作用。现有生物医学 IE 基准通常范围狭窄,依赖稀疏监督或自动生成的标注,限制了其在推动稳健 IE 方法发展方面的作用。我们引入GutBrainIE,基于超过1600篇PubMed摘要构建,由生物医学和术语学专家精细标注,包含细粒度实体、概念级链接及关系。虽以肠脑轴为背景,但该基准的丰富模式、多个任务以及高度精选与弱监督数据相结合的特性,使其广泛适用于生物医学 IE 系统在不同领域的开发与评估。

关键词

引用

@article{arxiv.2602.04320,
  title  = {A Domain-Specific Curated Benchmark for Entity and Document-Level Relation Extraction},
  author = {Marco Martinelli and Stefano Marchesin and Vanessa Bonato and Giorgio Maria Di Nunzio and Nicola Ferro and Ornella Irrera and Laura Menotti and Federica Vezzani and Gianmaria Silvello},
  journal= {arXiv preprint arXiv:2602.04320},
  year   = {2026}
}

备注

Accepted to EACL 2026