MeDAL:用于自然语言理解预训练的医疗缩写消歧数据集
计算与语言
2020-12-29 v1 人工智能
机器学习
摘要
禁止在许多当前NLP方法用于临床环境的最大挑战之一是公共数据集的可用性。在本文中,我们提出MeDAL,一个为缩写消歧策划的大型医疗文本数据集,专为医疗领域的自然语言理解预训练而设计。我们在该数据集上预训练了若干常见架构的模型,并通过实验表明,此类预训练在下游医疗任务微调时可带来性能与收敛速度的提升。
引用
@article{arxiv.2012.13978,
title = {MeDAL: Medical Abbreviation Disambiguation Dataset for Natural Language Understanding Pretraining},
author = {Zhi Wen and Xing Han Lu and Siva Reddy},
journal= {arXiv preprint arXiv:2012.13978},
year = {2020}
}
备注
EMNLP 2020 Clinical NLP