中文

面向生物医学 NER 和实体链接基准测试的诊断框架:从语料库角度

计算与语言 2026-05-21 v1

摘要

生物医学命名实体识别(NER)和实体链接(EL)强烈依赖标注语料,但这些资源的实用性常被假设而非系统描述。我们提出了一种从语料库注释、概念链接、训练-测试划分、文档元数据和术语映射中直接诊断基准测试相关属性的语料库中心框架。该框架将标准化统计信息组织为五大类别:(1)规模、密度和标签分布;(2)词汇和概念结构;(3)训练-测试重叠;(4)元数据组成;(5)术语覆盖范围(如适用)。将该框架应用于覆盖疾病、化学品和细胞类型的九个语料库,我们发现即使针对同一明显任务,语料库属性也可能存在显著差异。我们发现差异体现在评估信号的提供方式、泛化需求的施加程度、训练-测试重用的程度,以及生物医学文献和概念空间的代表范围上。这些差异表明,常见报告的语料库统计数据可能不足以描述生物医学 NER 和 EL 基准测试评估的内容。我们认为语料库中心的诊断提供了一种实用的框架,用于超越语料库大小和实体类型等表面描述符来分析语料库,识别潜在的迁移风险,并解释基准测试结论的范围。我们将该框架作为开源代码发布,并附带交互式仪表板,以支持复现我们的分析并 characterize 额外的语料库。

关键词

引用

@article{arxiv.2605.20537,
  title  = {What Do Biomedical NER and Entity Linking Benchmarks Measure? A Corpus-Centric Diagnostic Framework},
  author = {Robert Leaman and Rezarta Islamaj and Zhiyong Lu},
  journal= {arXiv preprint arXiv:2605.20537},
  year   = {2026}
}

备注

Accepted to the ACL 25th Workshop on Biomedical Language Processing