CKD-EHR:基于临床知识蒸馏的电子健康记录
计算与语言
2025-06-19 v1
摘要
基于电子健康记录(EHR)的疾病预测模型已在促进精准医学和实现早期干预方面发挥出显著的临床价值。然而,现有的大型语言模型面临两个主要挑战:医学知识的表征不足以及在临床部署中的效率低下。为此,我们提出 CKD-EHR(Clinical Knowledge Distillation for EHR)框架,通过知识蒸馏技术实现高效且准确的疾病风险预测。具体而言,首先对大型语言模型 Qwen2.5-7B 在医学知识增强数据上进行微调,以用作教师模型。随后通过多粒度注意力蒸馏机制生成可解释的软标签。最后将蒸馏的知识传递给轻量级 BERT 学生模型。实验结果表明,在 MIMIC-III 数据集上,CKD-EHR 的表现显著优于基线模型:诊断准确率提高 9%,F1 分数提升 27%,实现 22.2 倍的推理加速。该创新解决方案不仅大幅提高了资源利用效率,还显著提升了诊断准确性和及时性,为临床环境中的资源优化提供了实用技术方法。该研究的代码和数据已提供于 https://github.com/209506702/CKD_EHR。
引用
@article{arxiv.2506.15118,
title = {CKD-EHR:Clinical Knowledge Distillation for Electronic Health Records},
author = {Junke Wang and Hongshun Ling and Li Zhang and Longqian Zhang and Fang Wang and Yuan Gao and Zhi Li},
journal= {arXiv preprint arXiv:2506.15118},
year = {2025}
}
备注
20 pages,5 figures