ELMTEX:针对结构化临床信息提取微调大型语言模型。针对临床报告的案例研究
计算与语言
2025-07-09 v1 人工智能
摘要
欧洲医疗系统需要增强互操作性和数字化,推动对处理遗留临床数据创新解决方案的需求。本文展示了我们项目的结果,旨在利用大型语言模型(LLM)从非结构化临床报告中提取结构化信息,聚焦于患者史、诊断、治疗以及其他预定义类别。我们开发了一个带有用户界面的工作流程,并通过提示策略和微调评估了不同规模的 LLM。我们的结果表明,微调的较小模型在性能上可以匹配或超越较大的模型,为资源受限的环境提供了效率。构建了一个包含 60,000 篇标注的英语临床摘要和 24,000 篇德语翻译的新数据集,并通过自动和手动检查进行了验证。评估使用了 ROUGE、BERTScore 和实体级指标。该工作突显了该方法的可行性,并概述了未来的改进方向。
引用
@article{arxiv.2502.05638,
title = {ELMTEX: Fine-Tuning Large Language Models for Structured Clinical Information Extraction. A Case Study on Clinical Reports},
author = {Aynur Guluzade and Naguib Heiba and Zeyd Boukhers and Florim Hamiti and Jahid Hasan Polash and Yehya Mohamad and Carlos A Velasco},
journal= {arXiv preprint arXiv:2502.05638},
year = {2025}
}