UMLS元词表中大规模生物医学词汇对齐的UVA资源
人工智能
2022-05-24 v1
摘要
UMLS(统一医学语言系统)元词表的构建与维护过程耗时、昂贵且易出错,因其依赖(1)用于建议同义词的词法与语义处理,以及(2)UMLS编辑者的专业知识来审核这些建议。为改进UMLS元词表构建过程,我们的研究组定义了一项称为UVA(UMLS词汇对齐)的新任务并生成了用于评估该任务的数据集。我们组还使用逻辑规则(RBA)和神经网络(LexLM与ConLM)为该任务开发了不同基线。本文提供一组可复用且可复现的资源,包括(1)数据集生成器,(2)使用该生成器生成的三个数据集,以及(3)三种基线方法。我们描述了UVA数据集生成器及其针对任意给定UMLS版本的通用实现。我们通过生成对应于三个UMLS版本(2020AA、2021AA和2021AB)的数据集来演示该生成器的使用。我们提供使用三种现有方法(LexLM、ConLM和RBA)的三种UVA基线。代码、数据集与实验均公开可用、可复用,并可针对任意UMLS版本复现(下载UMLS需无费用许可协议)。
引用
@article{arxiv.2205.10575,
title = {UVA Resources for the Biomedical Vocabulary Alignment at Scale in the UMLS Metathesaurus},
author = {Vinh Nguyen and Olivier Bodenreider},
journal= {arXiv preprint arXiv:2205.10575},
year = {2022}
}