中文

CLIN-X:预训练语言模型及临床领域概念抽取中的跨任务迁移研究

计算与语言 2022-05-24 v3 机器学习

摘要

自然语言处理(NLP)领域近来发生了重大转变,几乎任何任务都趋向于使用预训练语言模型来解决。尽管这些模型在各种任务的基准数据集上表现出巨大提升,但在临床领域等非标准领域中往往表现欠佳,其预训练文档与目标文档之间存在显著差距。本文旨在通过领域特定的语言模型训练来缩小这一差距,并研究其对一系列不同下游任务与设置的影响。我们提出了预训练的 CLIN-X(Clinical XLM-R)语言模型,并展示了 CLIN-X 在两种语言的十个临床概念抽取任务上大幅优于其他预训练 transformer 模型。此外,我们展示了如何通过我们提出的基于随机划分集成与跨句上下文的、任务与语言无关的模型架构来进一步提升该 transformer 模型。我们在低资源与迁移设置下的研究表明,即便缺乏标注数据,模型性能依然稳定,在仅有 250 条标注句子时 F1 值提升高达 47 个点。我们的结果凸显了专用语言模型(如 CLIN-X)在非标准领域概念抽取中的重要性,同时也表明我们的任务无关模型架构在所测试的任务与语言上具有鲁棒性,因此无需领域或任务特定的适配。

关键词

引用

@article{arxiv.2112.08754,
  title  = {CLIN-X: pre-trained language models and a study on cross-task transfer for concept extraction in the clinical domain},
  author = {Lukas Lange and Heike Adel and Jannik Strötgen and Dietrich Klakow},
  journal= {arXiv preprint arXiv:2112.08754},
  year   = {2022}
}

备注

This article has been accepted for publication in Bioinformatics \c{opyright}: 2022 The Author(s). Published by Oxford University Press. All rights reserved. The published manuscript can be found here: https://doi.org/10.1093/bioinformatics/btac297