中文

高效可靠的命名实体链接质量估计:基于 GutBrainIE 的案例研究

计算与语言 2026-01-13 v1

摘要

命名实体链接(Named Entity Linking, NEL)是生物医学信息抽取(Information Extraction, IE)管道的核心组件,但由于专家标注成本高且语料规模庞大,难以对其进行大规模质量评估。本文提出一种基于抽样的框架,用于在统计保证和受限标注预算约束下,估计大规模 IE 语料库的 NEL 准确率。我们将 NEL 准确率估计建模为一个受约束的优化问题,目标是最小化预期标注成本,同时满足语料库级准确率估计的目标误差范围(Margin of Error, MoE)。基于近期关于知识图谱准确率估计的工作,我们将分层两阶段聚类抽样(Stratified Two-Stage Cluster Sampling, STWCS)应用于 NEL 场景,定义基于标签的分层和与 NEL 标注无关的全局表面形式聚类。应用于 GutBrainIE 中的 11,184 条 NEL 标注——该 biomedical 语料库于 2025 年秋季公开发布——我们的框架通过仅手动标注 2,749 条样本(占比 24.6%),即可达到 MoE ≤ 0.05,得到整体准确率估计为 0.915±0.04730.915 \pm 0.0473。基于时间成本模型和与简单随机抽样(Simple Random Sampling, SRS)基线的仿真结果表明,在固定样本量下,我们的设计约为专家标注时间缩短约 29%。该框架具有通用性,可应用于其他 NEL 基准数据集和需要可扩展且统计上稳健准确性评估的 IE 管道。

关键词

引用

@article{arxiv.2601.06624,
  title  = {Efficient and Reliable Estimation of Named Entity Linking Quality: A Case Study on GutBrainIE},
  author = {Marco Martinelli and Stefano Marchesin and Gianmaria Silvello},
  journal= {arXiv preprint arXiv:2601.06624},
  year   = {2026}
}

备注

Submitted to IRCDL 2026: 22nd Conference on Information and Research Science Connecting to Digital and Library Science, February 19-20 2026, Modena, Italy