中文

LongBEL:长上下文与文档一致性的医学实体链接

计算与语言 2026-05-14 v1

摘要

医学实体链接将文本提及映射到结构化知识库(如 UMLS 或 SNOMED CT)中的概念。大多数现有系统独立地链接每个提及,只使用提及本身或其周围句子,忽略同一文档中提及之间的依赖关系,尤其在同一概念以不同表面形式出现时,可能导致不一致的预测。我们提出 LongBEL,一个文档级别的生成框架,结合全文档上下文与先前预测的记忆。为使记忆更加稳健,LongBEL 使用交叉验证预测而非金标准标签进行训练,减少训练与推理之间的差距,限制级联误差。实验在英语、法语和西班牙语的五个医学基准数据集上表明,LongBEL 在句子级别生成基线上取得了改进,尤其在概念频繁在文档内重复出现的 datasets 上 gains 最大。在本地、全局和记忆基变体的集成实现了所有基准数据集的最佳结果。进一步分析表明,最大的提升发生在重复概念上,表明 LongBEL 主要改进了文档级别的一致性,而非单个提及的消歧。

关键词

引用

@article{arxiv.2605.13451,
  title  = {LongBEL: Long-Context and Document-Consistent Biomedical Entity Linking},
  author = {Adam Remaki and Xavier Tannier and Christel Gérardin},
  journal= {arXiv preprint arXiv:2605.13451},
  year   = {2026}
}

备注

9 pages, 2 figures