BIBERT-Pipe:BioASQ 2025 上基于生物医学嵌套命名实体链接的系统
计算与语言
2025-09-15 v1
摘要
生物医学文本的实体链接(EL)通常在英语-only 语料上进行基准测试,且针对平坦提及进行评估,导致更真实场景下的嵌套和多语言提及问题几乎未被探索。我们present了用于 BioNNE 2025 多语言生物医学嵌套命名实体链接共享任务(英语与俄语)的系统,通过轻量级管道实现,仅修改三个任务对齐的组件:两阶段检索-排序。我们采用相同的基础编码器模型用于两个阶段:检索阶段使用原始预训练模型,排序阶段应用领域特定微调。边界线索。在排序阶段,我们将每个提及包裹于可学习的 [Ms] / [Me] 标记,为编码器提供明确的、语言无关的跨度,增强对重叠和嵌套的鲁棒性。数据增强。我们还自动扩展了排序训练语料库,添加三个互补数据源,无需额外手动标注即可提升覆盖范围。在 BioNNE 2025 排行榜上,我们的两阶段系统 BIBERT-Pipe 在多语言轨道中排名第三,展示了这些最小且原则性修改的有效性和竞争性。代码已公开于 https://github.com/Kaggle-Competitions-Code/BioNNE-L。
关键词
引用
@article{arxiv.2509.09725,
title = {BIBERT-Pipe on Biomedical Nested Named Entity Linking at BioASQ 2025},
author = {Chunyu Li and Xindi Zheng and Siqi Liu},
journal= {arXiv preprint arXiv:2509.09725},
year = {2025}
}