基于负样本学习的医学生成式实体链接
计算与语言
2025-08-05 v3
摘要
生成式模型因其卓越的性能和高效的内存使用情况,在医学实体链接(BioEL)中越来越受到欢迎。然而,这些模型通常仅使用正样本进行训练,即与输入提及标识符相匹配的实体,不会显式地从难负样本中学习——后者是看似相似但意义不同的实体。为此,我们引入ANGEL(医学生成式实体链接中的负样本学习),首个能够使用负样本训练生成式BioEL模型的框架。具体而言,首先训练生成式模型从知识库中为给定输入实体生成正确的实体名称。随后,收集模型顶部k个预测中的正确输出和错误输出。最后,通过偏好优化更新模型,以优先考虑正确的预测。我们的方法在五个基准数据集上比以前最好的基线模型提高了最高可达平均1.4%的top-1准确率。当将本框架集成到预训练中时,性能提升进一步提高到1.7%,表明其在预训练和微调阶段均有效。代码和模型权重可在https://github.com/dmis-lab/ANGEL获取。
引用
@article{arxiv.2408.16493,
title = {Learning from Negative Samples in Biomedical Generative Entity Linking},
author = {Chanhwi Kim and Hyunjae Kim and Sihyeon Park and Jiwoo Lee and Mujeen Sung and Jaewoo Kang},
journal= {arXiv preprint arXiv:2408.16493},
year = {2025}
}
备注
ACL 2025 (Findings)