中文

CORE-BEHRT:一种经过精心优化与严格评估的BEHRT

机器学习 2024-10-14 v4

摘要

电子健康记录(EHR)的广泛采用显著增加了可用医疗数据的数量。这使得受自然语言处理(NLP)和计算机视觉启发且具有出色可扩展性的模型能够用于EHR研究。特别是,在BEHRT和Med-BERT发布后,基于BERT的模型迅速普及。尽管这些开创性模型的基本设计选择仍未得到充分探索,但后续模型在很大程度上建立在这些基础之上。通过增量优化,我们研究了基于BERT的EHR建模,并分离了关键设计选择的改进来源,使我们深入了解数据表示、单个技术组件和训练过程的影响。在一组通用任务(死亡、疼痛治疗和一般感染)中对此进行评估,我们表明改进数据表示可以将平均下游性能从0.785提高到0.797 AUROC(p<107p<10^{-7}),尤其是在包含药物和时间戳时。在此基础之上改进架构和训练协议,将平均下游性能提高到0.801 AUROC(p<107p<10^{-7})。然后,我们通过对25项不同临床预测任务的严格评估,证明了优化的稳定性。我们观察到25项任务中有17项取得了显著的性能提升,24项任务有所改善,突显了我们结果的泛化能力。我们的发现为未来的工作提供了坚实的基础,旨在提高基于BERT的EHR模型的可信度。

关键词

引用

@article{arxiv.2404.15201,
  title  = {CORE-BEHRT: A Carefully Optimized and Rigorously Evaluated BEHRT},
  author = {Mikkel Odgaard and Kiril Vadimovic Klein and Sanne Møller Thysen and Espen Jimenez-Solem and Martin Sillesen and Mads Nielsen},
  journal= {arXiv preprint arXiv:2404.15201},
  year   = {2024}
}

备注

33 pages, 6 figures, 7 tables, accepted to MLHC 2024, to be published in Proceedings of Machine Learning Research 252