中文

面向小样本表型化的通用可迁移患者语言表示学习

计算与语言 2021-03-15 v1 机器学习

摘要

通过迁移学习进行表示学习的范式有潜力极大地增强临床自然语言处理。在这项工作中,我们提出了一种多任务预训练与微调方法,用于从医学语言中学习通用且可迁移的患者表示。该模型首先使用不同但相关的高患病率表型进行预训练,并在下游目标任务上进一步微调。我们的主要贡献集中于该技术对低患病率表型所能产生的影响,这是一个由于数据匮乏而具有挑战性的任务。我们验证了预训练得到的表示,并将多任务预训练模型在包括38种循环系统疾病、23种呼吸系统疾病和17种泌尿生殖系统疾病的低患病率表型上进行微调。我们发现多任务预训练提高了学习效率,并在大多数表型上持续取得高性能。最重要的是,多任务预训练几乎总是表现最佳的模型,或与其非常接近而可被容忍,我们将这一性质称为鲁棒。所有这些结果使我们得出结论:这种多任务迁移学习架构是为众多表型开发通用且可迁移患者语言表示的鲁棒方法。

关键词

引用

@article{arxiv.2103.00482,
  title  = {Generalized and Transferable Patient Language Representation for Phenotyping with Limited Data},
  author = {Yuqi Si and Elmer V Bernstam and Kirk Roberts},
  journal= {arXiv preprint arXiv:2103.00482},
  year   = {2021}
}

备注

Journal of Biomedical Informatics (in press)