中文

Hybrid X-Linker: 面向生物医学实体链接的自动数据生成与极端多标签排序

计算与语言 2024-10-23 v1 人工智能 数字图书馆

摘要

最先进的深度学习实体链接方法依赖于大量人工标注数据,获取成本高昂。当前数据集规模有限,导致生物医学概念覆盖不足,且应用于新数据时性能下降。在这项工作中,我们提出自动生成数据以创建大规模训练数据集,从而允许探索最初为极端多标签排序任务开发的方法在生物医学实体链接任务中的应用。我们提出了混合X-Linker流水线,该流水线包含不同模块,分别将疾病和化学实体提及链接到MEDIC和CTD-Chemical词汇表中的概念。X-Linker在多个生物医学数据集上进行了评估:BC5CDR-Disease、BioRED-Disease、NCBI-Disease、BC5CDR-Chemical、BioRED-Chemical和NLM-Chem,分别达到了0.8307、0.7969、0.8271、0.9511、0.9248和0.7895的top-1准确率。X-Linker在三个数据集上表现出优越性能:BC5CDR-Disease、NCBI-Disease和BioRED-Chemical。相比之下,SapBERT在其余三个数据集上优于X-Linker。两个模型的操作都仅依赖于提及字符串。X-Linker的源代码及其相关数据已公开,可用于执行生物医学实体链接,而无需来自特定知识组织系统的预标注实体标识符。

关键词

引用

@article{arxiv.2407.06292,
  title  = {Hybrid X-Linker: Automated Data Generation and Extreme Multi-label Ranking for Biomedical Entity Linking},
  author = {Pedro Ruas and Fernando Gallego and Francisco J. Veredas and Francisco M. Couto},
  journal= {arXiv preprint arXiv:2407.06292},
  year   = {2024}
}

备注

This work has been submitted to the IEEE for possible publication