中文

在大规模儿科理赔数据上预训练基于 Transformer 的框架以用于下游人群特定任务

机器学习 2021-06-25 v1 人工智能

摘要

在过去十年中,电子健康记录(EHR)的采用已变得普及,这为基于数据的深入研究提供了条件。通过学习大量医疗数据,已构建各种数据驱动模型以预测不同医疗任务的未来事件,如自动诊断与心脏病发作预测。尽管 EHR 丰富,但满足特定标准以学习人群特定任务的人群稀缺,使得训练数据饥渴的深度学习模型具有挑战性。本研究提出 Claim Pre-Training(Claim-PT)框架,一种通用预训练模型,先在全部儿科理赔数据集上训练,再在每个特定人群任务上进行判别性微调。医疗事件的语义信息可在预训练阶段捕获,并通过任务感知的微调阶段完成有效知识迁移。微调过程仅需极小参数修改且无需改变模型架构,从而缓解数据稀缺问题并有助于在小患者队列上充分训练深度学习模型。我们在具有超过一百万患者记录的真实世界理赔数据集上进行了实验。两个下游任务的实验结果证明了方法的有效性:我们通用且与任务无关的预训练框架优于定制的任务特定模型,相比基线在模型性能上提升超过 10%。此外,我们的框架展现出从一机构向另一机构迁移所学知识的良好泛化潜力,为未来跨机构的医疗模型预训练铺平道路。

关键词

引用

@article{arxiv.2106.13095,
  title  = {Pre-training transformer-based framework on large-scale pediatric claims data for downstream population-specific tasks},
  author = {Xianlong Zeng and Simon Lin and Chang Liu},
  journal= {arXiv preprint arXiv:2106.13095},
  year   = {2021}
}