序列化电子健康记录适用于优异文本表示
计算与语言
2025-10-17 v1 人工智能
摘要
基础模型的出现为从大规模临床数据中学习通用表征提供了新的途径。然而,现有方法往往难以协调电子健康记录(EHR)中表格化和事件化结构与自然语言模型的序列先验之间的差异。这种结构性不匹配限制了其捕捉患者 encounters 横跨时间依赖性的能力。我们引入SerialBEHRT,一种领域对齐的基础模型,通过在结构化 EHR 序列上进行额外预训练来扩展 SciBERT。SerialBEHRT 旨在编码临床事件之间的时间和情境关系,从而产生更丰富的患者表征。我们评估了其在抗生素抗性预测任务中的效果,该任务在抗生素管理中具有临床意义。通过对抗先进 EHR 表征策略的广泛基准测试,我们展示了 SerialBEHRT 在性能上优于并且更一致,凸显了在基础模型预训练中采用时间序列化对医疗保健的重要性。
引用
@article{arxiv.2510.13843,
title = {Serialized EHR make for good text representations},
author = {Zhirong Chou and Quan Qin and Shi Li},
journal= {arXiv preprint arXiv:2510.13843},
year = {2025}
}