Labrador:探索掩码语言建模在实验室数据中的极限
计算与语言
2024-12-06 v2 人工智能
机器学习
摘要
在本工作中,我们介绍了 Labrador,一种针对实验室数据预训练的 Transformer 模型。Labrador 和 BERT 均在来自电子健康记录(EHRs)的 1 亿条实验室测试结果语料库上进行了预训练,并在各种下游结果预测任务上进行了评估。两个模型都展示了对预训练任务的掌握能力,但在下游监督任务中均未 consistently 超越 XGBoost。我们的消融研究表明,迁移学习对 BERT 的效果有限,对 Labrador 仅取得边际成功。我们探讨了迁移学习失败的原因,并提出仅靠实验室数据不足以充分表征每位患者背后的数据生成过程等因素。我们鼓励未来的工作专注于多种 EHR 数据类别的联合建模,并在评估中包含基于树的基线方法。
引用
@article{arxiv.2312.11502,
title = {Labrador: Exploring the Limits of Masked Language Modeling for Laboratory Data},
author = {David R. Bellamy and Bhawesh Kumar and Cindy Wang and Andrew Beam},
journal= {arXiv preprint arXiv:2312.11502},
year = {2024}
}
备注
26 pages, 8 figures, best paper award at ML4H 2024