为预训练临床语言模型重写电子健康记录
计算与语言
2024-12-02 v1
摘要
临床语言模型对医疗保健领域的多个应用至关重要, 但其开发依赖于大规模临床文本的预训练数据。然而, 由于患者隐私 concerns, 从电子健康记录 (EHR) 中获取临床笔记数据具有挑战性。本研究采用大语言模型 (LLM) 重写现有临床笔记, 生成合成的预训练语料, 借鉴了针对 web 数据重写的先前工作。我们检查了四种流行的小型 LLM (<10B 参数) 以创建合成临床文本, 用于预训练基于解码器和基于编码器的语言模型。该方法在语言建模和下游任务上的结果优于此前的合成方法, 无需引用真实临床文本。我们发现, 在有限的 token 预算下, 通过增强原始临床笔记以来自不同 LLM 的合成语料, 可进一步提升性能, 这表明该方法在机构层面上支持预训练, 或可扩展以生成大规模临床语料库。
引用
@article{arxiv.2411.18940,
title = {Rephrasing Electronic Health Records for Pretraining Clinical Language Models},
author = {Jinghui Liu and Anthony Nguyen},
journal= {arXiv preprint arXiv:2411.18940},
year = {2024}
}