协调临床旋律:面向临床编码中住院病程摘要的大语言模型微调
计算与语言
2024-09-25 v2 机器学习
摘要
电子病历系统中临床文档数量与复杂性的日益增加,给临床编码员带来了巨大挑战,他们必须在脑海中处理并总结海量临床文本,以提取编码任务所需的关键信息。尽管近年来大语言模型已成功应用于较短的摘要任务,但住院病程摘要的挑战仍是一个有待进一步研究与开发的开放领域。在本研究中,我们使用量化低秩微调,针对住院病程摘要任务微调了三个预训练大语言模型:Llama 3、BioMistral 和 Mistral Instruct v0.1。我们通过拼接各类临床记录作为输入临床文本,并配对从出院摘要中提取的真实住院病程简述部分,利用 MIMIC III 数据构建了一个自由文本临床数据集用于模型训练。微调后的模型使用 BERTScore 和 ROUGE 指标进行评估,以考察临床领域微调的有效性。此外,我们还使用一种专门针对临床编码定制的全新住院病程摘要评估指标,验证了它们的实用价值。研究结果表明,针对临床领域微调预训练大语言模型可显著提升其在住院病程摘要任务上的表现,并表明了其作为临床编码辅助工具的潜力。未来的工作应侧重于改进数据整理方法,以构建专为住院病程摘要任务量身定制的高质量临床数据集,并适配更先进的开源大语言模型以媲美专有模型,从而进一步推进本研究。
引用
@article{arxiv.2409.14638,
title = {Harmonising the Clinical Melody: Tuning Large Language Models for Hospital Course Summarisation in Clinical Coding},
author = {Bokang Bi and Leibo Liu and Sanja Lujic and Louisa Jorm and Oscar Perez-Concha},
journal= {arXiv preprint arXiv:2409.14638},
year = {2024}
}
备注
20 pages, 4 figures