可复现的合成临床信件用于癫痫发作频率信息提取
信息检索
2026-03-13 v1
摘要
癫痫发作频率信息对癫痫研究和临床护理至关重要,但通常以变动的自由文本 clinic 信件形式记录,难以标注和共享。我们开发了一个可复现、隐私保护的框架,用于从全合成且任务忠实的癫痫信件中提取发作频率。我们定义了覆盖常见癫痫负荷描述的结构化标签方案,包括显式频率、范围、聚类、癫痫自由间隔、未知频率以及显式无癫痫陈述。教师语言模型生成的 NHS 风格合成信件配有标准化标签、理由和证据片段。我们在这些合成信件上对若干开源语言模型(参数量为4B至14B)进行微调,以从完整文档中提取癫痫频率,比较直接数值预测与结构化标签预测,并测试证据导向的输出。在一组由临床医生审核的独立真实 clinic 信件测试集上,仅使用合成数据训练的模型泛化能力良好,结构化标签 consistently 优于直接数值回归。以15,000份合成训练信件为基准,模型在细粒度类别上的微-F1 分数可达0.788,在实用主义类别上可达0.847;一个面向医疗领域的4B模型分别达到0.787和0.858。证据导向的输出也支持快速的临床验证和错误分析。这些结果表明,合成的、结构化的、证据导向的监督数据可实现稳健的癫痫频率提取,无需共享敏感患者文本,可能推广至其他具有时序复杂性的临床信息提取任务。
引用
@article{arxiv.2603.11407,
title = {Reproducible Synthetic Clinical Letters for Seizure Frequency Information Extraction},
author = {Yujian Gan and Stephen H. Barlow and Ben Holgate and Joe Davies and James T. Teo and Joel S. Winston and Mark P. Richardson},
journal= {arXiv preprint arXiv:2603.11407},
year = {2026}
}