面向生物医学实体链接的知识富集自监督方法
计算与语言
2022-05-24 v2
摘要
实体链接面临诸多挑战,如大量变体与普遍歧义,尤其在拥有无数实体的高价值领域。标准分类方法受限于标注瓶颈,无法有效处理未见实体。零样本实体链接已成为泛化至新实体的一条有前景的方向,但其训练仍需要示例性的黄金实体提及,且所有实体均需规范描述,而这两者除维基百科外很少可得。本文利用易得的领域知识,探索面向生物医学实体链接的知识富集自监督()。训练中,它借助领域本体在无标注文本上生成自监督提及样本,并使用对比学习训练上下文编码器。推断时,它为每一实体采样自监督提及作为原型,通过将测试提及映射至最相似原型完成链接。若可得实体描述与黄金提及标签,本方法亦可便捷融入。我们在涵盖生物医学文献与临床记录的七个标准数据集上开展了充分实验。在不使用任何标注信息的情况下,我们的方法产出了 ——一个面向四百万 UMLS 实体的通用实体链接器,取得了新的最优结果,准确率较先前自监督方法最高提升 20 个绝对百分点。
引用
@article{arxiv.2112.07887,
title = {Knowledge-Rich Self-Supervision for Biomedical Entity Linking},
author = {Sheng Zhang and Hao Cheng and Shikhar Vashishth and Cliff Wong and Jinfeng Xiao and Xiaodong Liu and Tristan Naumann and Jianfeng Gao and Hoifung Poon},
journal= {arXiv preprint arXiv:2112.07887},
year = {2022}
}