用于建模健康记录的数据增强方法及其在肝素治疗失败检测中的应用
机器学习
2024-02-29 v1
摘要
我们提出了一种新颖的数据增强方法,以解决利用自然语言处理(NLP)算法对电子健康记录(EHR)中患者纵向模式建模时数据稀缺的挑战。该方法通过重新排列访视中医疗记录的顺序来生成增强数据(如果存在的话)。将该方法应用于肝素治疗失败检测任务后,在预训练过程中使用该方法可使ROC-AUC提升最高可达5.3个百分点(从未使用增强时的0.908提升至使用增强后的0.961)。此外,还证明了该增强方法在微调程序中也能提高性能,尤其是在标记训练数据有限的情况下。
引用
@article{arxiv.2402.18046,
title = {Data augmentation method for modeling health records with applications to clopidogrel treatment failure detection},
author = {Sunwoong Choi and Samuel Kim},
journal= {arXiv preprint arXiv:2402.18046},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2310.08757