中文

MeDAL:用于自然语言理解预训练的医疗缩写消歧数据集

计算与语言 2020-12-29 v1 人工智能 机器学习

摘要

禁止在许多当前NLP方法用于临床环境的最大挑战之一是公共数据集的可用性。在本文中,我们提出MeDAL,一个为缩写消歧策划的大型医疗文本数据集,专为医疗领域的自然语言理解预训练而设计。我们在该数据集上预训练了若干常见架构的模型,并通过实验表明,此类预训练在下游医疗任务微调时可带来性能与收敛速度的提升。

关键词

引用

@article{arxiv.2012.13978,
  title  = {MeDAL: Medical Abbreviation Disambiguation Dataset for Natural Language Understanding Pretraining},
  author = {Zhi Wen and Xing Han Lu and Siva Reddy},
  journal= {arXiv preprint arXiv:2012.13978},
  year   = {2020}
}

备注

EMNLP 2020 Clinical NLP