基于同义边际化的生物医学实体表示
计算与语言
2020-05-04 v1 机器学习
摘要
生物医学命名实体在许多生物医学文本挖掘工具中常扮演重要角色。然而,由于所提供的同义词不完整且表面形式存在大量变体,生物医学实体的规范化非常具有挑战性。本文中,我们专注于仅基于实体同义词来学习生物医学实体的表示。为从不完整同义词中学习,我们使用基于模型的候选选择,并最大化顶层候选中同义词的边际似然。我们的基于模型的候选随模型演化被迭代更新,以包含更困难的负样本。以此方式,我们避免了从超过 40 万候选中显式预选负样本。在具有三种不同实体类型(疾病、化学物、不良反应)的四个生物医学实体规范化数据集上,我们的模型 BioSyn 持续优于先前最先进(SOTA)模型,几乎达到各数据集上的上限。
引用
@article{arxiv.2005.00239,
title = {Biomedical Entity Representations with Synonym Marginalization},
author = {Mujeen Sung and Hwisang Jeon and Jinhyuk Lee and Jaewoo Kang},
journal= {arXiv preprint arXiv:2005.00239},
year = {2020}
}
备注
ACL 2020